ZHN

中文 Hacker News

由社区提交并经人工审核的人工智能、编程、创业与科技文章。

  1. 1.
    OpenAI 发布 GPT-6 Sol 与 Luna:API 价格较 GPT-5.6 促销价降低 50% (openai.com)

    OpenAI 于 2026 年 9 月 22 日发布 GPT-6 Sol 与 Luna。官方定价显示,Sol 的输入/输出价为每百万 token 2/10 美元,Luna 为 0.10/0.50 美元,均较 GPT-5.6 促销定价低 50%。公司披露了专业工作、编程与电脑操作等评测;这些性能结论应结合其公布的任务与设置理解。

    意义:前沿模型竞争延伸至单位智能成本

  2. 2.
    阿里云公布全栈 AI 路线图:芯片、Qwen 4 与 10 万亿参数规划 (alibabacloud.com)

    阿里云在 9 月 22 日云栖大会公布自研 AI 芯片、训练中的 Qwen 4,以及未来 Qwen 4.5/5 达到 5 至 10 万亿参数的规划;部分性能、算力和成本数据为公司披露,尚待独立评估。

    意义:中国云厂商加速纵向整合 AI 基础设施

  3. 3.
    SpaceXAI 推出 Grok 4.7,独立评测显示长程智能体任务提升 (x.ai)

    SpaceXAI 于 9 月 21 日发布 Grok 4.7,称模型面向编码和知识工作。Artificial Analysis 在 xhigh 设置下测得其 Intelligence Index 为 46,Coding Agent Index 为 56;任务输出 token 用量也高于 4.6。

    意义:长程智能体评测需同时看能力与资源代价

  4. 4.
    Anthropic 发布 Claude Opus 5.5:定价下调并开放模型评测细节 (anthropic.com)

    Anthropic 于 9 月 22 日发布 Claude Opus 5.5,称其输入/输出价格降至每百万 token 4/20 美元;Artificial Analysis 以统一方法测得其 Intelligence Index 为 58。基准比较受推理强度与运行设置影响。

    意义:模型能力、成本与安全评测同步披露

  5. 5.
    Anthropic:Claude 发现类 CRISPR 新酶系统,功能仍待验证 (anthropic.com)

    Anthropic 称,约 950 个 Claude 智能体在 21 小时内筛查 20 余万个逆转录酶,提出名为 ART 的噬菌体酶系统;团队已做初步实验,但其生物学功能尚未确定,并公开预印本。

    意义:展示 AI 驱动生物假设发现的可审查边界

  6. 6.
    Arena 实测:同一编码模型的 Agent Harness 可令成本相差最高 5 倍 (arena.ai)

    Arena 在 SWE-bench Lite 和 Terminal-Bench 2.0 上测试 7 个模型与 Claude Code、Codex CLI、Pi 的 21 种组合;每项任务运行三次。报告称成功率差异有限,但同一模型成本最高相差 5 倍,结论限于两项基准。

    意义:编码智能体应同时评估模型与运行框架

  7. 7.
    Google 公开 Private AI Compute 的加密云端长期记忆架构 (deepmind.google)

    Google 介绍为 Private AI Compute 增加跨设备持久记忆的设计:数据在硬件隔离的云端 enclave 中短暂解密,密钥由用户设备持有;同时发布可验证服务器软件记录和独立安全审计更新。

    意义:为云端个人 AI 的长期记忆提供隐私架构

  8. 8.
    Anthropic 发布 Claude Opus 5.5:成本较 Opus 5 降 40% (anthropic.com)

    Anthropic 于 9 月 22 日发布 Claude Opus 5.5,称其多数任务表现接近 Fable 5.1、运行成本较 Opus 5 低 40%,并经 Frontier Design 与 METR 等外部评估。Artificial Analysis 的同日评测报告了其具体基准和价格比较。

    意义:前沿智能体模型继续下探使用成本

  9. 9.
    Anthropic:Claude 辅助发现具 CRISPR 样重复序列的新型酶系统 (anthropic.com)

    Anthropic 称,其生命科学团队以约 950 个 Claude 智能体在 21 小时内分析 DNA 序列,发现与反转录酶相邻的重复序列系统 ART;研究者已做初步实验,但其具体功能仍在研究,技术报告已公开。

    意义:AI 假设生成进入湿实验验证流程

  10. 10.
    Anthropic:Claude 辅助发现具 CRISPR 样重复序列的新型酶系统 (anthropic.com)

    Anthropic 报告称,约 950 个 Claude 智能体在 21 小时内筛查 DNA 数据后提出 ART 候选;研究人员完成初步实验。ART 的功能仍待进一步验证,相关技术报告已公开。

    意义:AI 进入可实验验证的生物发现流程

  11. 11.
    Qwen 开源 Qwen-Image-2.1:7B 统一图像生成、编辑与透明图层 (huggingface.co)

    Qwen 发布 7B 视觉生成组件的 Qwen-Image-2.1。模型将文生图、图像编辑和原生 RGBA 透明图生成整合到同一管线,支持最多 10 张参考图、局部标注编辑,并提供 Diffusers 本地部署示例。

    意义:开放模型把生成、编辑与透明素材工作流合并

  12. 12.
    NASA/JAXA 直接观测脉冲星吸积伴星“恒星风” (science.nasa.gov)

    NASA 与 JAXA 的 XRISM 用高分辨率 X 射线光谱直接观测到 BP Crucis 系统中等离子体流向脉冲星,推算速度约每小时 54 万公里;相关论文已发表于《Science Advances》。

    意义:为风供给脉冲星吸积提供直接证据

  13. 13.
    Anthropic 推出生命科学验证计划:分级放开模型生物学能力 (anthropic.com)

    Anthropic 为通过资质、安保和伦理审查的生命科学机构提供分级访问:标准用途放宽生物学拦截,高风险项目需额外审查;相关流量会进行离线模式监测并保留 30 天。

    意义:探索生物 AI 的分级治理机制

  14. 14.
    OpenAI 发布模型失配披露框架与六起案例 (openai.com)

    OpenAI 发布模型失配事件的跟踪、调查与披露框架,并首次公开六起训练或评测中的异常行为案例;框架说明报告内容、调查轨道与安全披露边界。

    意义:推动前沿模型安全事件透明化

  15. 15.
    NASA:确认最年轻已知系外行星,年龄不足 100 万年 (science.nasa.gov)

    NASA 9 月 16 日报道,研究团队利用 Keck 档案中 2018 和 2020 年观测的运动信息,确认 Elias 2-24 b 是一颗不足 100 万年的木星质量系外行星。它位于距离母星约 55 倍日地距离的原行星盘空隙中;研究发表于《Astrophysical Journal Letters》,可用于检验行星形成模型。

    意义:为行星形成早期阶段提供罕见观测证据

  16. 16.
    NVIDIA 披露 Vera Rubin NVL72 首次 MLPerf 推理结果:Qwen3-VL 吞吐最高提升 3.7 倍 (blogs.nvidia.com)

    NVIDIA 9 月 16 日公布 MLPerf Inference v6.1 预览提交:Vera Rubin NVL72 在 DeepSeek-R1 与 Qwen3-VL 两项基准中首次参测;文中称 Qwen3-VL 吞吐最高为 GB300 NVL72 的 3.7 倍、DeepSeek-R1 为 2.5 倍。结果属于 MLPerf Closed Division,具体比较受任务、场景和软硬件配置限制。

    意义:提供新一代推理集群的可比基准

  17. 17.
    《Science》发表“虚拟生物科技”:3.7 万智能体协作药物研发 (science.org)

    《Science》9 月 17 日发表研究:Virtual Biotech 以首席科学官智能体协调多类专业代理,在 55,984 项临床试验中由逾 3.7 万代理整理结果,并用于肺癌靶点与失败试验分析。论文报告细胞类型特异基因靶向药物上市概率高 48%、不良事件少 32%;该框架产出仍属需实验验证的研发假设。

    意义:多智能体开始覆盖端到端药物研发证据整合

  18. 18.
    Anthropic 开源 Claude 优化的生物分子模型代码:平均提速约 4 倍 (anthropic.com)

    Anthropic 9 月 17 日称,Claude 在不足四周内优化 30 多个开源生物分子、蛋白设计与基因组模型;在最小精度损失下平均加速约 4 倍,输出完全一致时近 2 倍。其开源代码还提供低内存模式,可在单个 NVIDIA GPU 节点上预测超过 1 万 token 的生物分子系统;性能为发布方测试结果。

    意义:降低蛋白结构预测与设计的算力门槛

  19. 19.
    OpenAI 推出 Astra for Law:以法律检索与治理控制增强 GPT‑6 Astra (openai.com)

    OpenAI 于 9 月 17 日发布 Astra for Law:在 GPT‑6 Astra 上加入逾 2.3 亿 URL 的美国法律检索索引、法律分析指令与事务所治理控制。公司在 Vals AI 的 200 题私有验证集中报告,最高推理档总体正确性通过率为 54.0%,对照为网页搜索版 GPT‑6 Astra 的 38.7%;首批仅向受邀律所开放。

    意义:垂直 AI 正转向可审计数据与行业控制

  20. 20.
    Artificial Analysis 更新能力指标:调整长上下文与智能体工具使用权重 (artificialanalysis.ai)

    Artificial Analysis 发布 Capability Indices v1.1,按职业任务映射基准;更新纳入 Intelligence Index v4.2/4.3 的分项,在可获得领域切片处使用专门评测,并明确各领域的新增、移除评测与权重变化。

    意义:模型比较应同时看任务定义与评测权重

  21. 21.
    Mistral 与 Mozilla 将隐私优先的多语种 AI 浏览引入 Firefox 测试版 (mistral.ai)

    Mistral 与 Mozilla 宣布,Firefox Smart Window 测试版将采用 Mistral 模型,先覆盖法国和北美;双方称对话默认不保存在 Mozilla 服务器,Mistral 承诺零数据保留,并计划扩展至英国和德国。

    意义:浏览器 AI 的隐私与模型选择开始进入实际产品

  22. 22.
    Apple 推出 Reference Image:从传感器到云端的可验证摄影链路 (security.apple.com)

    Apple 宣布 iPhone 18 Pro 系列可选的 Reference Image 模式:传感器在拍摄时签名像素与元数据,私有云计算在可审计环境中处理,并以混合后量子签名与可撤销机制验证照片来源。

    意义:为 AI 时代照片真实性提供端到端技术路径

  23. 23.
    NASA 实测自主机器人编队:在科学目标与风险间动态分工 (science.nasa.gov)

    NASA 与合作方在 7 月实测由无人机和两台漫游车组成的 ASTRA 机器人编队:系统能依据科学目标、环境风险和新发现分配任务,并向人类管理者汇报。项目面向深空、月球和火星等通信延迟或高风险场景。

    意义:多机器人自主科学决策迈向实地验证

  24. 24.
    Salesforce 与 NVIDIA 发布 CRM 推理模型 Koa,进入客户试点 (salesforce.com)

    Salesforce 与 NVIDIA 发布面向 Agentforce 的 Koa:以 Nemotron 3 Super 后训练,使用模拟 CRM 工作流数据,不用客户数据训练;官方称模型在其 CRM 基准上以约三分之一错误率达到或超过领先模型,现向部分客户试点。

    意义:垂直推理模型强调数据边界与工作流

  25. 25.
    NASA 与 IBM 开源月球科学基础模型:整合多源观测数据 (newsroom.ibm.com)

    NASA 与 IBM 发布开源 Lunar Foundation Model 及数据集,汇集四项任务九台仪器的 30 余层对齐数据,用于冰沉积、陨石坑和火山地貌研究。公告称其在部分月球地貌识别任务中较对照方法最高降低 22% 误差。

    意义:开放 AI 基础设施加速月球科学

  26. 26.
    Anthropic 发布 AI 军事情报与常规武器能力评测 (anthropic.com)

    Anthropic Frontier Red Team 发布对身份关联、图像地理定位和常规武器任务的模拟评测;报告称部分任务中模型已具备以往稀缺专家的能力,并明确数据合成性等局限。

    意义:扩展前沿模型军民两用风险评测范围

  27. 27.
    Anthropic 披露 AI 滥用报告:覆盖网络攻击、监控与生物风险 (anthropic.com)

    Anthropic 报告称,其在 2025 年 12 月至 2026 年 8 月间干扰了利用 Claude 的恶意活动,涵盖网络攻击、影响行动、监控、诈骗、生物风险、常规武器与蒸馏,并与有关机构和行业伙伴共享情报。

    意义:为前沿模型滥用风险提供案例与防御信号

  28. 28.
    OpenAI 在 API 推出 GPT‑Live‑1:支持全双工语音智能体 (openai.com)

    OpenAI 将 GPT‑Live‑1 接入 API:模型可同时听说,支持打断处理、长会话、电话接入,并能把推理与工具调用委派给后端模型;其效果数据来自早期客户评估。

    意义:语音智能体从串联管线转向端到端交互

  29. 29.
    OpenAI 推出 Agents API 公测:托管 Codex 智能体运行环境 (openai.com)

    OpenAI 发布公测版 Agents API,将 Codex 的长程智能体 harness、工具调用、多智能体协调与可配置托管沙箱提供给开发者;开发者按 token 与工具付费。

    意义:降低生产级智能体基础设施门槛

  30. 30.
    Anthropic 更新四起模型评测越权事件的对齐安全评估 (anthropic.com)

    Anthropic 复盘四起 Claude 在网络安全评测中因环境配置问题而接触真实第三方系统的事件。新增事件涉及早期 Claude Opus 4.6;公司称已通知受影响方,并将审查范围扩至约 4.81 亿段记录,同时修订事实细节。

    意义:前沿模型评测的隔离与审计要求升级