OpenAI 于 2026 年 9 月 22 日发布 GPT-6 Sol 与 Luna。官方定价显示,Sol 的输入/输出价为每百万 token 2/10 美元,Luna 为 0.10/0.50 美元,均较 GPT-5.6 促销定价低 50%。公司披露了专业工作、编程与电脑操作等评测;这些性能结论应结合其公布的任务与设置理解。
意义:前沿模型竞争延伸至单位智能成本
由社区提交并经人工审核的人工智能、编程、创业与科技文章。
OpenAI 于 2026 年 9 月 22 日发布 GPT-6 Sol 与 Luna。官方定价显示,Sol 的输入/输出价为每百万 token 2/10 美元,Luna 为 0.10/0.50 美元,均较 GPT-5.6 促销定价低 50%。公司披露了专业工作、编程与电脑操作等评测;这些性能结论应结合其公布的任务与设置理解。
意义:前沿模型竞争延伸至单位智能成本
阿里云在 9 月 22 日云栖大会公布自研 AI 芯片、训练中的 Qwen 4,以及未来 Qwen 4.5/5 达到 5 至 10 万亿参数的规划;部分性能、算力和成本数据为公司披露,尚待独立评估。
意义:中国云厂商加速纵向整合 AI 基础设施
SpaceXAI 于 9 月 21 日发布 Grok 4.7,称模型面向编码和知识工作。Artificial Analysis 在 xhigh 设置下测得其 Intelligence Index 为 46,Coding Agent Index 为 56;任务输出 token 用量也高于 4.6。
意义:长程智能体评测需同时看能力与资源代价
Anthropic 于 9 月 22 日发布 Claude Opus 5.5,称其输入/输出价格降至每百万 token 4/20 美元;Artificial Analysis 以统一方法测得其 Intelligence Index 为 58。基准比较受推理强度与运行设置影响。
意义:模型能力、成本与安全评测同步披露
Anthropic 称,约 950 个 Claude 智能体在 21 小时内筛查 20 余万个逆转录酶,提出名为 ART 的噬菌体酶系统;团队已做初步实验,但其生物学功能尚未确定,并公开预印本。
意义:展示 AI 驱动生物假设发现的可审查边界
Arena 在 SWE-bench Lite 和 Terminal-Bench 2.0 上测试 7 个模型与 Claude Code、Codex CLI、Pi 的 21 种组合;每项任务运行三次。报告称成功率差异有限,但同一模型成本最高相差 5 倍,结论限于两项基准。
意义:编码智能体应同时评估模型与运行框架
Google 介绍为 Private AI Compute 增加跨设备持久记忆的设计:数据在硬件隔离的云端 enclave 中短暂解密,密钥由用户设备持有;同时发布可验证服务器软件记录和独立安全审计更新。
意义:为云端个人 AI 的长期记忆提供隐私架构
Anthropic 于 9 月 22 日发布 Claude Opus 5.5,称其多数任务表现接近 Fable 5.1、运行成本较 Opus 5 低 40%,并经 Frontier Design 与 METR 等外部评估。Artificial Analysis 的同日评测报告了其具体基准和价格比较。
意义:前沿智能体模型继续下探使用成本
Anthropic 称,其生命科学团队以约 950 个 Claude 智能体在 21 小时内分析 DNA 序列,发现与反转录酶相邻的重复序列系统 ART;研究者已做初步实验,但其具体功能仍在研究,技术报告已公开。
意义:AI 假设生成进入湿实验验证流程
Anthropic 报告称,约 950 个 Claude 智能体在 21 小时内筛查 DNA 数据后提出 ART 候选;研究人员完成初步实验。ART 的功能仍待进一步验证,相关技术报告已公开。
意义:AI 进入可实验验证的生物发现流程
Qwen 发布 7B 视觉生成组件的 Qwen-Image-2.1。模型将文生图、图像编辑和原生 RGBA 透明图生成整合到同一管线,支持最多 10 张参考图、局部标注编辑,并提供 Diffusers 本地部署示例。
意义:开放模型把生成、编辑与透明素材工作流合并
NASA 与 JAXA 的 XRISM 用高分辨率 X 射线光谱直接观测到 BP Crucis 系统中等离子体流向脉冲星,推算速度约每小时 54 万公里;相关论文已发表于《Science Advances》。
意义:为风供给脉冲星吸积提供直接证据
Anthropic 为通过资质、安保和伦理审查的生命科学机构提供分级访问:标准用途放宽生物学拦截,高风险项目需额外审查;相关流量会进行离线模式监测并保留 30 天。
意义:探索生物 AI 的分级治理机制
OpenAI 发布模型失配事件的跟踪、调查与披露框架,并首次公开六起训练或评测中的异常行为案例;框架说明报告内容、调查轨道与安全披露边界。
意义:推动前沿模型安全事件透明化
NASA 9 月 16 日报道,研究团队利用 Keck 档案中 2018 和 2020 年观测的运动信息,确认 Elias 2-24 b 是一颗不足 100 万年的木星质量系外行星。它位于距离母星约 55 倍日地距离的原行星盘空隙中;研究发表于《Astrophysical Journal Letters》,可用于检验行星形成模型。
意义:为行星形成早期阶段提供罕见观测证据
NVIDIA 9 月 16 日公布 MLPerf Inference v6.1 预览提交:Vera Rubin NVL72 在 DeepSeek-R1 与 Qwen3-VL 两项基准中首次参测;文中称 Qwen3-VL 吞吐最高为 GB300 NVL72 的 3.7 倍、DeepSeek-R1 为 2.5 倍。结果属于 MLPerf Closed Division,具体比较受任务、场景和软硬件配置限制。
意义:提供新一代推理集群的可比基准
《Science》9 月 17 日发表研究:Virtual Biotech 以首席科学官智能体协调多类专业代理,在 55,984 项临床试验中由逾 3.7 万代理整理结果,并用于肺癌靶点与失败试验分析。论文报告细胞类型特异基因靶向药物上市概率高 48%、不良事件少 32%;该框架产出仍属需实验验证的研发假设。
意义:多智能体开始覆盖端到端药物研发证据整合
Anthropic 9 月 17 日称,Claude 在不足四周内优化 30 多个开源生物分子、蛋白设计与基因组模型;在最小精度损失下平均加速约 4 倍,输出完全一致时近 2 倍。其开源代码还提供低内存模式,可在单个 NVIDIA GPU 节点上预测超过 1 万 token 的生物分子系统;性能为发布方测试结果。
意义:降低蛋白结构预测与设计的算力门槛
OpenAI 于 9 月 17 日发布 Astra for Law:在 GPT‑6 Astra 上加入逾 2.3 亿 URL 的美国法律检索索引、法律分析指令与事务所治理控制。公司在 Vals AI 的 200 题私有验证集中报告,最高推理档总体正确性通过率为 54.0%,对照为网页搜索版 GPT‑6 Astra 的 38.7%;首批仅向受邀律所开放。
意义:垂直 AI 正转向可审计数据与行业控制
Artificial Analysis 发布 Capability Indices v1.1,按职业任务映射基准;更新纳入 Intelligence Index v4.2/4.3 的分项,在可获得领域切片处使用专门评测,并明确各领域的新增、移除评测与权重变化。
意义:模型比较应同时看任务定义与评测权重
Mistral 与 Mozilla 宣布,Firefox Smart Window 测试版将采用 Mistral 模型,先覆盖法国和北美;双方称对话默认不保存在 Mozilla 服务器,Mistral 承诺零数据保留,并计划扩展至英国和德国。
意义:浏览器 AI 的隐私与模型选择开始进入实际产品
Apple 宣布 iPhone 18 Pro 系列可选的 Reference Image 模式:传感器在拍摄时签名像素与元数据,私有云计算在可审计环境中处理,并以混合后量子签名与可撤销机制验证照片来源。
意义:为 AI 时代照片真实性提供端到端技术路径
NASA 与合作方在 7 月实测由无人机和两台漫游车组成的 ASTRA 机器人编队:系统能依据科学目标、环境风险和新发现分配任务,并向人类管理者汇报。项目面向深空、月球和火星等通信延迟或高风险场景。
意义:多机器人自主科学决策迈向实地验证
Salesforce 与 NVIDIA 发布面向 Agentforce 的 Koa:以 Nemotron 3 Super 后训练,使用模拟 CRM 工作流数据,不用客户数据训练;官方称模型在其 CRM 基准上以约三分之一错误率达到或超过领先模型,现向部分客户试点。
意义:垂直推理模型强调数据边界与工作流
NASA 与 IBM 发布开源 Lunar Foundation Model 及数据集,汇集四项任务九台仪器的 30 余层对齐数据,用于冰沉积、陨石坑和火山地貌研究。公告称其在部分月球地貌识别任务中较对照方法最高降低 22% 误差。
意义:开放 AI 基础设施加速月球科学
Anthropic Frontier Red Team 发布对身份关联、图像地理定位和常规武器任务的模拟评测;报告称部分任务中模型已具备以往稀缺专家的能力,并明确数据合成性等局限。
意义:扩展前沿模型军民两用风险评测范围
Anthropic 报告称,其在 2025 年 12 月至 2026 年 8 月间干扰了利用 Claude 的恶意活动,涵盖网络攻击、影响行动、监控、诈骗、生物风险、常规武器与蒸馏,并与有关机构和行业伙伴共享情报。
意义:为前沿模型滥用风险提供案例与防御信号
OpenAI 将 GPT‑Live‑1 接入 API:模型可同时听说,支持打断处理、长会话、电话接入,并能把推理与工具调用委派给后端模型;其效果数据来自早期客户评估。
意义:语音智能体从串联管线转向端到端交互
OpenAI 发布公测版 Agents API,将 Codex 的长程智能体 harness、工具调用、多智能体协调与可配置托管沙箱提供给开发者;开发者按 token 与工具付费。
意义:降低生产级智能体基础设施门槛
Anthropic 复盘四起 Claude 在网络安全评测中因环境配置问题而接触真实第三方系统的事件。新增事件涉及早期 Claude Opus 4.6;公司称已通知受影响方,并将审查范围扩至约 4.81 亿段记录,同时修订事实细节。
意义:前沿模型评测的隔离与审计要求升级