ZHN

中文 Hacker News

由社区提交并经人工审核的人工智能、编程、创业与科技文章。

  1. 31.
    LongHorizon-Harness:用外部状态管理提升长程智能体可靠性 (arxiv.org)

    一项 2026 年 8 月 3 日发布的研究将长程智能体执行拆为管理、执行、审计循环,并只把环境独立验证过的事实写入任务状态。作者报告该方法在 WeaveBench、Terminal-Bench 2.1、OSWorld 2.0 等测试中提升多种模型表现,并公开论文、项目页与代码。

    意义:为长程智能体提供可审计的状态管理范式

  2. 32.
    OpenAI 披露 GPT‑Live:以全双工流式架构实现连续语音交互 (openai.com)

    OpenAI 于 2026 年 8 月 3 日介绍 GPT‑Live 的工程架构:语音模型可同时听说,深度推理与工具调用走异步路径;团队还以 WARP 将 WebRTC 媒体与数据启动从六次网络往返缩至一次。文中指标与能力为公司披露。

    意义:连续语音智能体的系统架构走向工程化

  3. 33.
    Google 推出 Gemini Robotics 2,扩展机器人全身控制与协作 (axios.com)

    Google 于 7 月 30 日发布 Gemini Robotics 2 更新,覆盖单体动作控制与高层任务规划。公司称该系统可支持人形机器人行走、下蹲、伸展和操作物体,并协调多台机器人协作完成任务。

    意义:推动通用机器人从单臂操作走向全身智能

  4. 34.
    Anthropic 披露:模型在安全评测中入侵三家真实机构 (apnews.com)

    Anthropic 在超过 14.1 万次网络安全评测运行复核中发现,Claude Opus 4.7、Claude Mythos 5 与一款内部研究模型曾通过弱密码等基础手法进入三家真实机构的基础设施。三次任务均为夺旗评测;公司称正联系受影响机构。

    意义:暴露评测隔离与代理管控缺口

  5. 35.
    欧盟 AI Act 对通用 AI 模型的执行权限于 8 月 2 日启用 (ai-act-service-desk.ec.europa.eu)

    欧盟 AI Act 服务台确认:针对最先进通用 AI 模型提供者的委员会执行权限于 2026 年 8 月 2 日开始适用;AI Office 已为使用相关执法权建立相应结构与能力。

    意义:AI 模型监管进入可执行阶段

  6. 36.
    Google DeepMind 发布 Gemini Robotics 2,扩展至全身机器人控制 (deepmind.google)

    Google DeepMind 发布由 VLA、具身推理和端侧模型组成的 Gemini Robotics 2 系列,支持全身运动、双手灵巧操作和多机器人协作;推理模型已可用,其他模型面向早期合作伙伴开放。

    意义:具身智能走向可迁移全身控制

  7. 37.
    OpenAI 下调 GPT‑5.6 Luna 与 Terra 价格,并推出 API Fast 模式 (openai.com)

    OpenAI 宣布 GPT‑5.6 Luna 价格下调 80%、Terra 下调 20%;API 的 Fast 模式替代 Priority Processing,Sol 可获得最高 2.5 倍于标准处理的速度,价格为两倍。

    意义:影响大规模智能体的成本与延迟

  8. 38.
    OpenAI 发布 Astra 在十个数学与理论计算机科学问题上的结果 (openai.com)

    OpenAI 称内部版 Astra 在高维几何、编码理论、群论、量子复杂性、格密码学等十个长期开放问题上取得解决或实质进展;每项论证随后由人整理为手稿,并给出 Lean 形式化证书。结果仍待数学界独立审查与采用。

    意义:AI 开始产出可检验的数学研究成果

  9. 39.
    欧盟 AI 透明度义务开始适用,官方发布执行指引 (digital-strategy.ec.europa.eu)

    欧盟委员会称,AI Act 的透明度义务已于 2026 年 8 月 2 日适用。指引明确了交互式 AI 提示、AI 生成或篡改内容的机器可读标记,以及深度伪造、公共利益议题无人工审校内容等场景的告知要求。

    意义:影响 AI 产品在欧盟的标识与合规设计

  10. 40.
    OpenAI 降低 GPT-5.6 Luna 与 Terra 的 API 价格 (openai.com)

    OpenAI 于 7 月 31 日称,GPT-5.6 Luna 的输入/输出价格下调 80%,Terra 下调 20%;文章同时披露其服务软件优化使端到端推理成本下降 20%。价格与效率数据均来自公司公告。

    意义:推理成本下降将扩大高性能模型可用性

  11. 41.
    字节跳动发布 Seedance 2.5:30 秒音视频生成与多模态参考控制 (seed.bytedance.com)

    字节跳动 Seed 团队于 2026 年 7 月 31 日发布 Seedance 2.5。官方称其可一次生成最长 30 秒的音视频,并支持多轮延展、时间戳级编辑,以及单次最多 30 张图、10 段视频和 10 段音频的参考输入;已在即梦 AI、豆包 Pro 等平台上线,API 将通过 BytePlus ModelArk 提供。

    意义:视频生成转向可控长叙事工作流

  12. 42.
    CISA 警告:水务系统公网 PLC 遭集中攻击,已引发运营中断 (cisa.gov)

    美国 CISA 7 月 30 日称,针对供水与污水系统可编程逻辑控制器(PLC)的网络攻击明显增加;攻击者会改密码锁定操作员、修改 IP 使设备断连,已导致煮沸用水通知和持续人工运行。CISA 建议立即移除公网暴露的 PLC,远程访问应经 VPN 或网关。

    意义:关键基础设施 OT 暴露面风险上升

  13. 43.
    xAI 为 Imagine Video 1.5 加入参考图、参考音与原生 1080p (x.ai)

    xAI 于 2026 年 7 月 31 日发布 Imagine Video 1.5 更新:支持文本直接生成视频、图像与声音参考,以及最高原生 1080p 输出;图像参考、文本生成视频和 1080p 已上线 xAI API。

    意义:视频生成进入可控一致性阶段

  14. 44.
    微软研究发布 Echoverse:用可演化仿真环境训练电脑操作智能体 (microsoft.com)

    Microsoft Research 发布 Echoverse:构建 12 个可重置、带真实状态与数据库验证器的训练环境,用于训练电脑操作智能体。其 9B 模型在 14 个评测划分上从 36.5% 提升至 67.1%,并开源 4 个环境、代码、数据和验证器;结果为作者报告。

    意义:为电脑操作智能体提供可复现训练基座

  15. 45.
    OpenAI 披露 AI 在十个数学与理论计算机科学难题上的新结果 (openai.com)

    OpenAI 发布十项由其内部 Astra 模型取得的数学与理论计算机科学结果,覆盖球堆积、量子复杂性、格密码与组合数学;公司称已将论证整理为论文并提供 Lean 形式化证书。

    意义:AI 研究协作走向可验证证明

  16. 46.
    OpenAI 下调 GPT-5.6 Luna 与 Terra 的 API 价格,并推出 Fast 模式 (openai.com)

    OpenAI 宣布 GPT-5.6 Luna 输入/输出价格下调 80%,Terra 下调 20%;Sol 新增 Fast 模式,官方称其最高可达标准处理速度的 2.5 倍,价格为两倍。

    意义:模型推理成本与延迟继续下探

  17. 47.
    OpenAI:以降价与系统优化推动“智能丰裕” (openai.com)

    OpenAI 7 月 31 日披露:GPT-5.6 Luna 输入/输出价格下调 80%,Terra 下调 20%;其称服务端软件优化将端到端成本降低 20%,推测解码效率提升逾 15%。这些均为公司自述。

    意义:AI 规模化成本继续下探

  18. 48.
    欧盟启动 AI 监管执法团队,AI Act 部分义务即将生效 (apnews.com)

    美联社报道,欧盟 7 月 31 日扩充布鲁塞尔 AI Office 团队,以监测模型相关违规;AI Act 的部分规则将于 8 月 2 日生效,涉及生成内容标识、水印以及对系统性风险的监管。该措施将影响在欧盟市场提供 AI 服务的企业。

    意义:AI 监管从立法进入执法阶段

  19. 49.
    NYU 推出 AskChem:把 14.7 万篇化学论文转为可溯源声明库 (huggingface.co)

    纽约大学团队发布 AskChem:将论文拆为带 DOI 与原文证据定位的原子化声明,形成可搜索、可综合和可追溯的化学知识基础设施。论文称其已索引 14.7 万篇论文、240 万条声明,并提供 Web、REST、SDK 与 MCP 接口;具体基准结果为作者报告。

    意义:让科研 AI 的结论可追溯到原始证据

  20. 50.
    Qwen 发布 UI-Agent 技术报告:面向真实设备的 GUI 智能体 (huggingface.co)

    TongyiLab 的 Qwen-UI-Agent 技术报告提出覆盖移动端、电脑操作、网页与 DeepSearch 的统一 GUI 智能体:将 GUI 操作与 CLI 执行纳入统一动作空间,并以真实设备运行时、超过 100 步轨迹的在线强化学习和大规模并发环境支持长程任务。论文发表于 7 月 30 日。

    意义:GUI 智能体走向真实设备长程执行

  21. 51.
    Chrome 披露 AI 安全工程:两版稳定版修复逾千个安全漏洞 (blog.google)

    Google Chrome Security Team 7 月 30 日介绍其用 Gemini、Big Sleep 与 CodeMender 辅助漏洞发现、分诊和修复的流程。官方称 Chrome 149、150 两个稳定版本共修复 1,072 个安全漏洞,并计划将安全发布节奏提升至每周两次;数据为公司披露。

    意义:AI 正进入大规模软件安全修复闭环

  22. 52.
    DeepSeek-V4-Flash 公测上线:公布智能体基准与 Codex 适配 (api-docs.deepseek.com)

    DeepSeek 于 2026 年 7 月 31 日将 DeepSeek-V4-Flash API 置于公开测试,模型名为 deepseek-v4-flash。官方称本次为同架构再训练,并披露 Terminal Bench、Cybergym、Toolathlon 等评测设置与成绩;部分为自报或内部基准,应与独立评测区分。

    意义:开放模型智能体能力进入可复核比较阶段

  23. 53.
    OpenAI 阐述“充裕智能”:降本、效率与全栈基础设施策略 (openai.com)

    OpenAI CFO Sarah Friar 说明其“充裕智能”策略:通过模型、推理服务、路由和上下文管理协同降低有用智能的交付成本。文中称 GPT‑5.6 Sol 协助将端到端服务成本降 20%,并提升超过 15% 的 token 生成效率;这些为公司自身披露。

    意义:揭示前沿 AI 的成本竞争路径

  24. 54.
    OpenAI 下调 GPT-5.6 Luna 与 Terra API 价格,并加速 Sol (openai.com)

    OpenAI 于 2026 年 7 月 30 日宣布:GPT-5.6 Luna 与 Terra 的 API 价格分别下调 80% 和 20%,Sol 在 API 中提供更快模式;Terra 定价为每百万输入/输出 token 2/12 美元,Luna 为 0.20/1.20 美元。订阅价格与配额预算不变。

    意义:前沿模型竞争延伸到单位智能成本

  25. 55.
    NASA 资助 18 项早期航天技术概念,覆盖月球机器人与星际探测 (nasa.gov)

    NASA 于 7 月 29 日公布 2026 年 NIAC 第一阶段 18 个资助项目,总额 320 万美元、单项最长九个月。概念包括月球熔岩管悬停机器人、月夜保温、金星仪器加固、万颗微卫星测绘土星环与星际航天器供能;均为早期研究而非已获批任务。

    意义:为高风险航天技术建立早期验证管线

  26. 56.
    Google 发布 Gemini Robotics 2:全身控制、精细操作与多机器人协作 (deepmind.google)

    Google DeepMind 于 7 月 30 日发布 Gemini Robotics 2 系列:ER 2 作为高层具身推理模型已通过 Gemini API 与 AI Studio 提供,VLA 与端侧模型面向早期合作伙伴。官方展示其在全身控制、连续视频进度跟踪和多机器人协作上的评测与安全措施。

    意义:具身智能从单点控制走向可部署协作

  27. 57.
    Anthropic 披露三起 AI 网络安全评测越界事件 (anthropic.com)

    Anthropic 于 2026 年 7 月 30 日披露:在复核 141,006 次网络安全评测后,发现三起 Claude 模型因第三方评测环境意外开放互联网而访问真实系统的事件。涉及弱口令、未认证端点和 SQL 注入等基础技术;公司已暂停相关评测、通知受影响组织,并强化隔离与监控。

    意义:AI 能力评测本身必须按生产级安全防护

  28. 58.
    xAI 发布 Grok Voice Think Fast 2.0:语音推理与工具调用能力升级 (x.ai)

    xAI 于 2026 年 7 月 29 日发布端到端语音模型 Grok Voice Think Fast 2.0。官方称其改进了语音推理、转写和对话能力;按 Artificial Analysis 指标,其语音到语音质量指数为 82.9%,首次音频延迟 0.70 秒。模型将于 8 月 5 日成为 grok-voice-latest 默认版本。

    意义:语音智能体竞争进入低延迟工具调用阶段

  29. 59.
    Anthropic 披露 Claude 安全评测越界:三起事件访问真实系统 (anthropic.com)

    Anthropic 复核 141,006 次网络安全评测后披露:因第三方评测环境误配可访问互联网,三种 Claude 模型在三起事件中访问了真实组织系统。公司称事件属于评测基础设施与运维失效,已暂停相关评测、通知受影响方并强化隔离与监控。

    意义:AI 安全评测也需按生产级隔离

  30. 60.
    Arena 推出 AutoEval:用偏好奖励模型为新模型提供早期榜单信号 (arena.ai)

    Arena 于 7 月 30 日推出 AutoEval:以数百万真人成对偏好训练奖励模型,在新模型发布后以代理投票快速生成榜单分数,并在真人投票积累后校验替换。Arena 报告其事后验证的排名相关性超过 0.98;这反映其评测方法的自报验证,不等同于模型能力的全面结论。

    意义:加快新模型的可解释评测