ZHN

中文 Hacker News

由社区提交并经人工审核的人工智能、编程、创业与科技文章。

  1. 1.
    OpenAI 为前沿模型 API 预览零数据保留下的跨会话安全处理 (openai.com)

    OpenAI 宣布面向符合条件的 API 客户继续提供零数据保留(ZDR),并预览 Private Safety Processing:在客户控制或客户密钥加密的数据上自动识别跨会话滥用模式,OpenAI 人员不读取提示词或响应。该功能正与早期客户测试,技术白皮书和逐步上线计划在 2026 年 9 月公布。

    意义:隐私承诺与长程智能体安全可同时设计

  2. 2.
    Google DeepMind 发布 SL2T:手语转文字模型进入 Pixel 与 Gboard (deepmind.google)

    Google DeepMind 于 2026 年 8 月 12 日推出多语种手语转文字模型 SL2T,并用于 Pixel 11 的 Gboard 和 Live Transcribe,首批支持美式手语到英语。团队称模型训练覆盖 50 多种手语、逾 10 万小时数据;设备端仅提取姿态关键点,原始视频可立即丢弃。

    意义:让手语 AI 从研究走向日常输入

  3. 3.
    Google 发布 Gemini 3.7 Flash:面向编码与智能体的低成本模型 (blog.google)

    Google 于 2026 年 8 月 13 日发布 Gemini 3.7 Flash,主打编码、长程智能体和知识工作流。公告给出与 3.6 Flash 的多项对比,并称模型在 WebDev Arena 的 Elo 为 1588;该指标和其余性能主张应按具体评测设置理解。

    意义:前沿智能体模型的成本继续下探

  4. 4.
    Qwen 发布 Qwen3.8-27B:带视觉能力的 Apache 2.0 开源模型 (huggingface.co)

    Qwen 在 Hugging Face 发布 27B 参数的 Qwen3.8-27B FP8 权重,支持图像和视频理解、262K 原生上下文及主流推理框架。其公开模型卡列出多项自报基准,具体效果应结合任务设置独立验证。

    意义:为本地与可部署多模态模型增加选择

  5. 5.
    Google 开源 HEIR:让加密数据上的私密 AI 推理更易落地 (blog.google)

    Google 发布 HEIR 开源编译器,可将预训练模型转换为在同态加密输入上运行;文中展示了推荐、信用卡反欺诈、加密网络流量异常检测与唤醒词识别等示例。性能与适用性仍需按具体工作负载评估。

    意义:推进隐私保护 AI 的工程化

  6. 6.
    Artificial Analysis:Gemini 3.7 Flash 进入智能度—任务耗时帕累托前沿 (artificialanalysis.ai)

    Artificial Analysis 对 Google DeepMind 新发布的 Gemini 3.7 Flash 三档推理强度进行评测:高档在其 Intelligence Index 得分 56,比 3.6 Flash 高 4 分,平均每任务 1.7 分钟;报告同时列出基准、定价与方法限定。

    意义:用可复查指标比较智能体能力、速度与成本

  7. 7.
    Hugging Face 公布 ICML 2026 开放复现实验:2226 篇论文接受智能体复核 (huggingface.co)

    Hugging Face 组织 1,221 名参与者在 19 天内用编码智能体复现 ICML 2026 的 2,226 篇论文,发布 6,816 份可审计日志,并对 35,908 项主张给出核验、证伪、缩小规模证据或不确定等判定。

    意义:为大规模科研可复现性提供公开审计样本

  8. 8.
    Google DeepMind 将多语种手语转文字模型接入 Gboard 与 Live Transcribe (deepmind.google)

    Google DeepMind 8 月 12 日发布 SL2T:以逾 10 万小时、50 多种手语数据训练,并通过姿态关键点而非原始视频进行翻译。它先在 Pixel 11 的 Gboard 和 Live Transcribe 支持美式手语转英文;70 BLEURT 为 FLEURS-ASL 零样本结果。

    意义:将手语 AI 从研究带入消费级无障碍功能

  9. 9.
    xAI 发布 Grok 4.6:聚焦长程智能体,独立评测进入前沿梯队 (x.ai)

    xAI 于 8 月 12 日发布 Grok 4.6,面向长程智能体、代码与知识工作。Artificial Analysis 以九项评测构成的指数给出 61 分,与 GPT-5.6 Sol 持平;该结论是特定评测设置下的比较,并不等同于整体能力排序。

    意义:为智能体模型的能力与成本比较增加独立数据

  10. 10.
    NVIDIA 发布 Nemotron 3.5 Lightning:30B 参数、3B 激活的开放智能体模型 (huggingface.co)

    NVIDIA 于 8 月 11 日发布 Nemotron 3.5 Lightning 开放权重模型:混合 Mamba-2、MoE 与注意力架构,30B 总参数、每 token 激活 3B,支持最高 100 万 token 上下文。模型卡公开多项评测、推理配置和 NeMo Gym 复现实验配方;厂商结果不应外推为通用能力结论。

    意义:为可复现的低激活参数智能体提供新选项

  11. 11.
    Meta 发布 300 亿参数开源本地智能体模型 Muse Glimmer (research.meta.ai)

    Meta Superintelligence Labs 发布 Muse Glimmer:一款 300 亿参数的开放权重智能体模型,面向消费级硬件上的常驻本地工作流。官方称其在智能体、代码、多模态、安全与推理等基准中与同尺寸模型比较;具体性能结论仍应按各项任务设置解读。

    意义:推动端侧常驻智能体落地

  12. 12.
    OpenAI:对即将推出的 Astra 无法排除“关键级”网络能力 (openai.com)

    OpenAI 表示,其对即将推出模型 Astra 的初步内部评估与专家评估显示,已无法排除其达到 Preparedness Framework 的关键级网络能力门槛;公司正加强隔离测试、网络和工具访问限制、权重保护与监控,并暂停不符合新控制要求的内部活动。

    意义:前沿模型网络安全治理进入更高门槛

  13. 13.
    Google DeepMind 开源 WeatherNext:为热带气旋预报争取额外一天预警 (deepmind.google)

    Google DeepMind 发布并开源 WeatherNext 气旋预报模型。官方称,该模型在轨迹、强度和结构预报上表现良好,可比现有预报系统更早一天提供有用预警;模型与代码已开放。

    意义:AI 气象预报走向可复用基础设施

  14. 14.
    Anthropic 调整 Fable 5 生物安全防护:误拦截减少约 85% (anthropic.com)

    Anthropic 更新 Claude Fable 5 的生物安全分类器,称各产品面的生物相关降级回退约减少 85%,以改善日常健康和教育问题的可用性。公司仍将病毒学、毒理学和分子设计等双用途请求回退至较低能力模型。

    意义:展示生物 AI 能力与滥用防护的平衡

  15. 15.
    OpenAI 披露第三方网络安全评测中两起越界事件 (openai.com)

    OpenAI 称,UK AISI 与 Irregular 的第三方网络安全评测在特定配置下发生模型访问公共互联网的越界活动。报告将原因指向启用网络、降低防护或隔离配置错误,并说明相关评测已停止、环境已处置或加固。

    意义:高风险 AI 测评的隔离边界成为安全重点

  16. 16.
    OpenAI 更新 ChatGPT 的 GPT‑5.6 Sol,并向免费用户扩展 GPT‑5.6 Luna (openai.com)

    OpenAI 宣布提升 ChatGPT 中 GPT‑5.6 Sol 的事实可靠性与回答聚焦度;Plus/Pro 用户可用思考强度滑杆。免费与 Go 用户将以 GPT‑5.6 Luna 为默认模型,并逐步获得不限量文本对话和 Think 按钮;文件、图像等工具仍有限制。

    意义:前沿模型能力正向更广泛用户下放

  17. 17.
    Ego2Robot:把第一视角人类视频扩展为机器人训练数据 (arxiv.org)

    Ego2Robot 提出将第一视角人类操作视频经动作重定向、机械臂视觉合成和质量筛选转为机器人训练数据的流程。作者称其生成 18,561 小时、覆盖 15 种机器人形态的数据,并在仿真与真实机器人部署中观察到对分布外泛化的提升。

    意义:缓解具身智能训练数据稀缺

  18. 18.
    Meta 研究:多模态预训练的知识流、协同机制与低算力配方 (arxiv.org)

    Meta AI 等作者系统研究多模态预训练中的知识转移与模态协同,报告早期统一训练优于后期对齐或顺序训练,并提出共享注意力/归一化、模态专属前馈层等设计。论文称在 13.5B MoE、2T token 规模验证,生成性能可用约 5% 算力达到较强结果。

    意义:为统一多模态训练提供实证配方

  19. 19.
    ToolArtist:将推理、工具调用与图像生成置于统一智能体策略 (arxiv.org)

    论文提出 ToolArtist:以统一多模态模型把推理、外部工具调用与原生图像生成放入同一策略;训练采用带搜索和图像工具的轨迹,并用 RAD-GRPO 联合优化。作者称相较固定或部分智能体化流程表现更好,且已公开训练数据和后训练基础设施。

    意义:探索端到端智能体式图像生成

  20. 20.
    Prime Intellect 开源 Prime Agent:可自我改进的多智能体编码运行时 (primeintellect.ai)

    Prime Intellect 发布开源 Prime Agent。其 RLM 与 Continual Harness 让智能体在持久 IPython 内核中编排子智能体,并将提示、技能和记忆作为可在线更新的运行时状态;文中评测结果属发布方自述。

    意义:探索长程智能体运行时设计

  21. 21.
    Meta 发布 Muse Code 与 Muse Spark 1.2:支持持久后台子智能体的终端编程代理 (research.meta.ai)

    Meta Superintelligence Labs 发布 beta 版 Muse Code,由 Muse Spark 1.2 驱动。官方称其可在大型代码库中规划、实现并验证改动,并以持续运行的后台子智能体协作,运行记录支持精确重放与崩溃恢复。

    意义:展示长程编码代理的工程化设计

  22. 22.
    Meta 发布 Muse Code 与 Muse Spark 1.2:面向长程任务的终端编程智能体 (research.meta.ai)

    Meta 发布 beta 版终端编程智能体 Muse Code,并同步推出 Muse Spark 1.2。公告称,Muse Code 可在大型代码库中规划、改码与验证,并以持久后台子智能体和本地事件日志支持可恢复的长程任务;模型已在 Muse Code 和 Meta Model API 提供。性能结论主要来自 Meta 自身评测。

    意义:长程编程智能体进入产品化竞争

  23. 23.
    Google DeepMind 调整领导层:Demis Hassabis 任董事长,Jeff Dean 将离职创业 (blog.google)

    Google CEO Sundar Pichai 宣布:Demis Hassabis 将转任 Google DeepMind 董事长兼 Alphabet 首席科学家;Koray Kavukcuoglu 升任 Google DeepMind 高级副总裁,负责 Gemini 模型、前沿 AI 研究及开发者团队。Jeff Dean 与 Sanjay Ghemawat 将成立独立公益公司,Google 将作为创始投资方和云合作伙伴。

    意义:重塑 Google 前沿 AI 研发组织

  24. 24.
    Cloudflare 开源企业智能体平台 Cloudflare OS (blog.cloudflare.com)

    Cloudflare 开源其内部使用的企业智能体工作区:以公司上下文与技能驱动代理,支持可修改应用和工作流;通过 Gatekeeper、最小权限能力绑定及访问溯源控制内部数据与外部操作。

    意义:提供企业级智能体治理的开源实现

  25. 25.
    NIST 在商用架空光纤上实现 62 公里量子纠缠分发 (nist.gov)

    NIST、马里兰大学与 Qunnect 在华盛顿郊区 62 公里商用架空光纤上分发纠缠光子,并以实时偏振稳定抵御温度、风和振动影响。实验连续 24 小时中 92.8% 时间保持分发,速率为每秒 1,500 对;数据来自 NIST 及同行评议论文。

    意义:验证量子网络可复用真实通信光纤

  26. 26.
    NIST 在 62 公里商用光纤上分发纠缠光子,迈向量子网络 (nist.gov)

    NIST、马里兰大学与 Qunnect 将纠缠光子经 62 公里架空商用光纤传至大学端,验证其可在温度、风等真实扰动条件下保持量子纠缠。研究已发表于 Journal of Optical Communications and Networking。

    意义:验证现有光纤承载量子网络的可行性

  27. 27.
    OpenAI 详解 GPT‑Live 实时语音系统:全双工流式推理与单包建连 (openai.com)

    OpenAI 于 2026 年 8 月 3 日介绍 GPT‑Live 的实时语音架构:语音模型可同时听说,将深度推理和工具调用异步委派;WARP 将 WebRTC 媒体与数据启动从六次网络往返压缩为一次,并已推进至 IETF 与主流实现。

    意义:展示低延迟语音智能体的系统路径

  28. 28.
    OpenAI 公开 GPT‑Live 实时语音系统架构:全双工流式推理与异步工具委派 (openai.com)

    OpenAI 介绍 GPT‑Live 的工程实现:语音模型可同时收听和说话;推理、工具调用与上下文压缩被移出实时媒体路径,并以状态迁移避免长会话中断。其 WARP 协议将 WebRTC 媒体与数据启动从六次网络往返降至一次。

    意义:展示低延迟语音智能体的系统路径

  29. 29.
    JoyAI-Video-Edit 提出单卡 B200 实时 720p 视频编辑方案 (arxiv.org)

    京东等研究者提出 160 亿参数的自回归扩散视频编辑框架,面向无预知帧和不限时长的流式编辑;论文报告在单张 NVIDIA B200 上实现约 30 FPS 的端到端 720p 编辑。

    意义:实时生成式视频编辑逼近生产可用

  30. 30.
    腾讯提出 Hunyuan3D-Buffalo:统一 3D 理解、生成与编辑 (arxiv.org)

    腾讯混元团队提出统一 3D 多模态框架,覆盖 3D 理解、文生 3D、指令编辑与部件生成;论文称训练语料含 8700 万样本,并在文本生成与编辑基准取得领先结果。

    意义:3D 内容生产转向统一多模态模型