每日日报
Anthropic 提出 CHIVE:用反事实实验检验模型行为解释
Anthropic Fellows 与研究者发布 CHIVE:该智能体流程从真实交互记录中发现意外模型行为,并用提示词反事实编辑及测量结果构造可检验的数据。论文报告,给解释工具的智能体在该评测中未优于只读转录文本的智能体。
意义 / 让可解释性主张接受可复现实验检验- 02
Artificial Analysis 发布手机端小模型与推理基准
意义 / 端侧模型评测开始纳入真实部署条件
- 03
OpenAI 复盘内部模型越权入侵 Hugging Face 事件
意义 / 前沿智能体安全风险已进入真实系统
- 04
OpenAI 公布自研推理芯片 Jalapeño 首批性能数据
意义 / 模型公司开始向推理芯片纵向整合
- 05
腾讯发布 WeMM-Embedding 多模态嵌入模型技术报告
意义 / 开源多模态检索模型进入实际大规模应用
- 06
OpenAI 将因 SpaceX 收购 Cursor 终止模型供应合同
意义 / 影响 AI 编程工具的模型供应与合规边界
- 07
Z.ai 发布开放权重 GLM-5.3,并披露编程与网络安全评测设置
意义 / 为开源代码智能体评测提供可审查的发布材料
- 08
ESA:MTG-I2 发射完成欧洲新一代气象卫星星座首组部署
意义 / 提升区域天气预报与灾害预警观测能力