小米机器人发布视觉—语言—动作基础模型 Xiaomi-Robotics-1。项目称其以超过 10 万小时真实世界操作轨迹预训练,并用跨本体真实机器人数据进行后训练;报告披露了新任务少样本适配与四项仿真基准结果。
意义:为具身智能的数据规模化提供实证路径
由社区提交并经人工审核的人工智能、编程、创业与科技文章。
小米机器人发布视觉—语言—动作基础模型 Xiaomi-Robotics-1。项目称其以超过 10 万小时真实世界操作轨迹预训练,并用跨本体真实机器人数据进行后训练;报告披露了新任务少样本适配与四项仿真基准结果。
意义:为具身智能的数据规模化提供实证路径
美国商务部与 NIST 7 月 16 日公告称,台积电将其美国先进制造与封装计划再增 1000 亿美元,累计计划投资 2650 亿美元,并新增四座设施,使先进晶圆厂及封装设施总数达 12 座。
意义:重塑先进芯片供应链与AI算力产能
Hugging Face 称已处置一起针对部分生产基础设施的入侵:攻击者利用数据集处理链路获得访问,并接触有限内部数据与服务凭据。平台称公共模型、数据集、Spaces 及软件供应链未发现被篡改;已关闭相关执行路径、重建节点并轮换凭据。
意义:AI 平台供应链安全的实战样本
NVIDIA 发布基于 Blackwell/Thor 的 Jetson 与 IGX T3000、Jetson T2000,覆盖机器人和边缘 AI;同时推出 Jetson agent skills,并扩展 40 亿参数 Cosmos 3 Edge 以支持端侧具身系统。
意义:压缩具身智能的端侧部署成本
NVIDIA 介绍 Vera Rubin 面向持续后训练的计算设计,并以 Nemotron 3 Ultra 的公开权重、训练配方与 SWE-bench Verified 成绩说明其“每美元智能”框架;性能与成本主张来自厂商。
意义:后训练正成为 AI 基础设施核心负载
Anthropic 复盘了用 Claude Code 完成大规模语言迁移的流程:Bun 从 Zig 迁至 Rust 产出约 100 万行代码,合并前通过既有测试;文章同时披露了令牌消耗、回归与验证方法。
意义:展示智能体代码迁移的验证边界
多伦多大学团队在 npj Robotics 发表开放获取研究,提出 CRAFT 模块化设计库,用可组合的结构与材料属性实现不同任务所需的连续体机器人机械性能,减少每次应用都从头定制的需求。论文发表于 7 月 11 日。
意义:加快柔性机器人任务定制
Intel 宣布扩大与 Google Cloud 的多年合作:在全球员工、工程、供应链等场景部署 Gemini Enterprise,并以云端 HPC 扩展芯片仿真和开发工作负载。公告描述的是企业部署计划,尚未披露量化研发提速数据。
意义:AI 正进入芯片研发核心流程
Kimi 文档称 Kimi K3 已上线:模型为 2.8 万亿参数,采用混合线性注意力与 MoE 架构,支持原生视觉和 100 万 token 上下文。完整权重计划于 7 月 27 日发布,当前可通过 API 使用。
意义:超大开源模型进入 API 阶段
Meta Superintelligence Labs 发布多模态推理模型 Muse Spark 1.1,称其针对工具与计算机使用、编程和多模态理解升级;该模型已在 Meta AI 应用和 meta.ai 的 Thinking 模式可用,并随新 Meta Model API 开启公开预览。
意义:大厂开放智能体模型 API
NVIDIA 与 Hugging Face 于 7 月 17 日发布联合文章:NeMo Automodel 现可直接微调 Hugging Face Hub 上的 Diffusers 格式模型,无需转换 checkpoint 或改写模型代码,并提供面向开源扩散模型的训练配方;集成以 Apache 2.0 开源。
意义:降低生成模型分布式训练门槛
独立评测机构 Artificial Analysis 于 7 月 17 日更新称,Kimi K3 在其 Intelligence Index 中排名第 3。该指数 v4.1 汇总 9 项评测,包含 GDPval-AA v2、Terminal-Bench v2.1、GPQA Diamond 等;该排名仅反映该机构的方法与版本,不能等同于整体能力结论。
意义:开源权重模型评测格局变化
xAI 于 7 月 16 日发布 Grok 4.5,现可通过 Grok Build、Cursor 与 API 使用。公告披露了其在多项软件工程基准上的结果、80 TPS 服务速度,以及每百万输入/输出 token 2/6 美元的定价;基准数据主要为公司自述,应结合独立评测理解。
意义:前沿编程智能体竞争再加速
华为称其在 WAIC 2026 首次线下展出 Atlas 950 SuperPoD 真机:1024 卡集群,面向大模型训练和高并发推理,并采用统一内存编址、超大互联带宽与低时延设计。文中性能与规模为厂商披露。
意义:观察国产 AI 算力架构进展
NASA 7 月 15 日说明,Artemis III 将在 2027 年进行示范任务:Orion 飞船与商业载人着陆系统在近地轨道完成交会和对接演练,再以无人方式返回地球。该流程用于在 2028 年载人登月前验证关键操作并降低风险。
意义:为商业月球着陆系统先行验证关键流程
Arena 的 2026 年 7 月 16 日榜单变更记录显示,Thinking Machines 的 Inkling 与 Kimi K3 已加入 Text Arena 和 Code Arena。该记录仅说明纳入该平台的对应评测榜单,不代表模型整体能力的最终结论。
意义:为模型比较补充可追溯基准入口
Google 宣布将 NotebookLM 更名为 Gemini Notebook:产品仍可独立使用,并将逐步接入 Gemini 应用和 Google Search;Pro 用户将获得在笔记本内直接运行代码进行数据分析的能力。
意义:研究型 AI 工具加速融入 Google 生态
Thinking Machines 的 Inkling 已在 Hugging Face 发布:约 975B 总参数、41B 激活参数,原生接收文本、图像和音频,提供 100 万上下文;同时给出 BF16 与 NVFP4 权重及 transformers、SGLang、vLLM、llama.cpp 的首日支持。
意义:开源多模态模型的部署门槛与生态支持进一步前移
哈佛-史密森天体物理中心团队报告,在距地球约 48 光年的 LHS 1140 b 上直接探测到氦。该行星为岩质、位于恒星宜居带;研究者强调这并不等于发现生命或已证实宜居。
意义:系外行星宜居性研究的关键观测进展
Hugging Face 称其数据集处理管道遭入侵:攻击者利用远程代码加载与模板注入取得部分内部数据和服务凭据访问。公司已关闭漏洞、重建节点并轮换凭据;目前未发现公开模型、数据集、Spaces 或软件供应链被篡改,受影响数据范围仍在评估。
意义:揭示 AI 平台供应链的新攻击面
Hume AI 发布 Real World VoiceEQ,覆盖 40 多个开源与闭源语音模型、15 余项评测维度和 60 多项指标。该基准基于逾 100 万次人类评分,强调口音、噪声、情绪与长对话等真实场景,并指出传统指标可能高估实际表现。
意义:为语音智能体提供更贴近真实体验的评测框架
NVIDIA 发布可商用的 Nemotron 3 Embed 系列。其 8B BF16 模型在 2026-07-15 的 RTEB 榜单位列第一(78.5%);同时提供 1B BF16 与面向 Blackwell 的 NVFP4 版本,并公开权重、数据集和训练配方。结论以该公司披露的评测设置为准。
意义:开放检索模型推动智能体基础设施
NVIDIA 宣布基于 Blackwell 的 Jetson/IGX T3000 与 Jetson T2000 模组;T3000 提供 865 FP4 TFLOPS,T2000 提供 400 FP4 TFLOPS。同期推出可在 Thor 设备端运行的 40 亿参数 Cosmos 3 Edge,并计划于 2027 年第一季度供应新模组。
意义:为具身智能提供更低功耗边缘算力
Cloudflare 宣布 Precursor 正式可用:它在浏览器内持续分析鼠标、滚动、输入节奏等聚合行为信号,以替代一次性验证码并识别规避型自动化流量;官方称无需改动网站代码即可启用。
意义:反机器人防护转向会话级验证
Artificial Analysis 报告,过去八天内多项模型发布使其 Intelligence Index 50 分以上的实验室由 6 月初的两家增至六家。文中同时给出模型版本、任务成本和多项榜单指标;结论受其私有基准与方法设定限制。
意义:量化前沿模型竞争与成本变化
OpenAI 于 7 月 17 日提出企业评估 AI 的四项指标:完成多少有价值工作、每项成功任务的完整成本、结果可靠性,以及规模化后每美元能否产出更多工作。该文强调不能只以席位数、活跃用户或 token 成本判断投入回报。
意义:把 AI ROI 从用量转向可验证产出
7 月 16 日,29 国在上海签署《建立世界人工智能合作组织协定》。新华社报道该组织旨在推动人工智能国际合作与全球治理,总部设在上海;路透社独立报道称 29 国为创始成员。
意义:全球 AI 治理新增跨国协调机制
Google DeepMind 与 Isomorphic Labs 于 7 月 16 日公布联合生物韧性方案:以预防、检测和响应三条线,将前沿模型提供给受信任伙伴;文中称过去 12 个月已推进逾 15 项与政府、生物安全组织及研究团体的合作。
意义:AI 生物安全进入可执行合作框架
Artificial Analysis 发布 EnterpriseOps-Gym-AA:在 8 个业务领域、164 张数据库表和 512 个工具的有状态环境中,以最终数据库状态和政策约束评分。榜首 Claude Fable 5 为 51%,Gemini 3.5 Flash 为 50%,说明真实企业代理任务仍远未解决。
意义:量化企业代理落地的可靠性缺口
Arena 发布 Factuality in the Arena,以带事实性标注的对战数据构建复合 Bradley-Terry 排名;默认将事实性权重设为 25%。该更新旨在避免仅凭用户偏好把不够可靠的模型推到榜首。
意义:为模型比较补上事实性维度