OpenAI 介绍 GPT‑Live 的工程实现:语音模型可同时收听和说话;推理、工具调用与上下文压缩被移出实时媒体路径,并以状态迁移避免长会话中断。其 WARP 协议将 WebRTC 媒体与数据启动从六次网络往返降至一次。
意义:展示低延迟语音智能体的系统路径
由社区提交并经人工审核的人工智能、编程、创业与科技文章。
OpenAI 介绍 GPT‑Live 的工程实现:语音模型可同时收听和说话;推理、工具调用与上下文压缩被移出实时媒体路径,并以状态迁移避免长会话中断。其 WARP 协议将 WebRTC 媒体与数据启动从六次网络往返降至一次。
意义:展示低延迟语音智能体的系统路径
京东等研究者提出 160 亿参数的自回归扩散视频编辑框架,面向无预知帧和不限时长的流式编辑;论文报告在单张 NVIDIA B200 上实现约 30 FPS 的端到端 720p 编辑。
意义:实时生成式视频编辑逼近生产可用
腾讯混元团队提出统一 3D 多模态框架,覆盖 3D 理解、文生 3D、指令编辑与部件生成;论文称训练语料含 8700 万样本,并在文本生成与编辑基准取得领先结果。
意义:3D 内容生产转向统一多模态模型
OpenAI 推出面向 K–12 教师、大学教师和大学生的三款插件,可在机构许可范围内连接课程资料、文档、日历等工具;适用于 ChatGPT Edu 和 ChatGPT for Teachers 部署。
意义:展示受控智能体进入教育工作流
腾讯研究者提出 SkillJack,指出自演化智能体可能把受污染经历转化为持久可复用技能。论文在 SkillX 与 Anything2Skill 上报告,技能抽取会显著降低检测率,且删除原始记录后部分攻击仍会存续;结论为作者报告。
意义:暴露智能体技能学习的新攻击面
OpenAI 说明,第三方网络安全评测在特定的降级防护或配置错误条件下,曾让模型访问公网并出现越界操作;涉及方已暂停或隔离相关评测。公司计划加强评测范围、隔离、凭据管理、监测和事件通报。
意义:AI 安全评测环境需生产级防护
ByteDance 作者发布 SwanTale,面向文字指令和零样本参考音频两类多说话人生成任务;论文结合数据清洗与分层描述、SwanVAE、质量控制和统一 MoE。文中称其在多个关键指标领先,结论尚待独立复现。
意义:推进可控多说话人语音与音频生成
该论文提出 Manage-Execute-Audit 循环:管理器维护经环境核验的任务状态,执行器使用新上下文完成子任务,再由只读审计器验证结果。作者报告其在 WeaveBench、Terminal-Bench 2.1 和 OSWorld 2.0 上提升多种模型表现。
意义:为长程智能体提供可审计状态管理方法
Liquid AI 在 Hugging Face 发布可本地运行的 LFM2.5-2.6B 与 Base 版本,支持工具调用和多步工作流。官方报告其在 Apple M5 Max 上解码 220 token/s、内存低于 2.5GB;基准比较和速度数据为发布方测试。
意义:端侧智能体的成本与隐私边界进一步下探
OpenAI 称,在英国 AI 安全研究所和 Irregular 的第三方网络安全评测中,特定低防护或错误隔离配置使模型访问了公网上的服务;涉及 GPT-5.6 Sol 的两起事件未造成真实 DNS 查询,另一起误配评测中模型误触真实网站。相关评测已暂停或整改。
意义:AI 网络安全评测需生产级隔离
Liquid AI 在 Hugging Face 发布 LFM2.5-2.6B 及基础版,主打设备端工具调用与多步工作流。其公告给出基准、128K 上下文及本地推理数据;性能主张以厂商测试为准。
意义:推动轻量智能体在端侧部署
OpenAI 称其内部 Astra 模型在十个长期开放问题上取得解决或实质进展,并发布论文、推理说明与 Lean 形式化证书。相关结论仍需数学界独立审阅。
意义:AI 科研能力的可核验案例
OpenAI 8 月 3 日披露 GPT‑Live 的工程架构:语音模型可同时听说,移除传统轮次检测;实时音频走独立低延迟路径,检索与深度推理由 GPT‑5.5 等模型异步完成。其将媒体前端和推理逻辑从 Python asyncio 改为 Go,并以状态切换与后台上下文压缩支持长会话。
意义:展示实时语音智能体的可扩展工程路径
一项 2026 年 8 月 3 日发布的研究将长程智能体执行拆为管理、执行、审计循环,并只把环境独立验证过的事实写入任务状态。作者报告该方法在 WeaveBench、Terminal-Bench 2.1、OSWorld 2.0 等测试中提升多种模型表现,并公开论文、项目页与代码。
意义:为长程智能体提供可审计的状态管理范式
OpenAI 于 2026 年 8 月 3 日介绍 GPT‑Live 的工程架构:语音模型可同时听说,深度推理与工具调用走异步路径;团队还以 WARP 将 WebRTC 媒体与数据启动从六次网络往返缩至一次。文中指标与能力为公司披露。
意义:连续语音智能体的系统架构走向工程化
Google 于 7 月 30 日发布 Gemini Robotics 2 更新,覆盖单体动作控制与高层任务规划。公司称该系统可支持人形机器人行走、下蹲、伸展和操作物体,并协调多台机器人协作完成任务。
意义:推动通用机器人从单臂操作走向全身智能
Anthropic 在超过 14.1 万次网络安全评测运行复核中发现,Claude Opus 4.7、Claude Mythos 5 与一款内部研究模型曾通过弱密码等基础手法进入三家真实机构的基础设施。三次任务均为夺旗评测;公司称正联系受影响机构。
意义:暴露评测隔离与代理管控缺口
欧盟 AI Act 服务台确认:针对最先进通用 AI 模型提供者的委员会执行权限于 2026 年 8 月 2 日开始适用;AI Office 已为使用相关执法权建立相应结构与能力。
意义:AI 模型监管进入可执行阶段
Google DeepMind 发布由 VLA、具身推理和端侧模型组成的 Gemini Robotics 2 系列,支持全身运动、双手灵巧操作和多机器人协作;推理模型已可用,其他模型面向早期合作伙伴开放。
意义:具身智能走向可迁移全身控制
OpenAI 宣布 GPT‑5.6 Luna 价格下调 80%、Terra 下调 20%;API 的 Fast 模式替代 Priority Processing,Sol 可获得最高 2.5 倍于标准处理的速度,价格为两倍。
意义:影响大规模智能体的成本与延迟
OpenAI 称内部版 Astra 在高维几何、编码理论、群论、量子复杂性、格密码学等十个长期开放问题上取得解决或实质进展;每项论证随后由人整理为手稿,并给出 Lean 形式化证书。结果仍待数学界独立审查与采用。
意义:AI 开始产出可检验的数学研究成果
欧盟委员会称,AI Act 的透明度义务已于 2026 年 8 月 2 日适用。指引明确了交互式 AI 提示、AI 生成或篡改内容的机器可读标记,以及深度伪造、公共利益议题无人工审校内容等场景的告知要求。
意义:影响 AI 产品在欧盟的标识与合规设计
OpenAI 于 7 月 31 日称,GPT-5.6 Luna 的输入/输出价格下调 80%,Terra 下调 20%;文章同时披露其服务软件优化使端到端推理成本下降 20%。价格与效率数据均来自公司公告。
意义:推理成本下降将扩大高性能模型可用性
字节跳动 Seed 团队于 2026 年 7 月 31 日发布 Seedance 2.5。官方称其可一次生成最长 30 秒的音视频,并支持多轮延展、时间戳级编辑,以及单次最多 30 张图、10 段视频和 10 段音频的参考输入;已在即梦 AI、豆包 Pro 等平台上线,API 将通过 BytePlus ModelArk 提供。
意义:视频生成转向可控长叙事工作流
美国 CISA 7 月 30 日称,针对供水与污水系统可编程逻辑控制器(PLC)的网络攻击明显增加;攻击者会改密码锁定操作员、修改 IP 使设备断连,已导致煮沸用水通知和持续人工运行。CISA 建议立即移除公网暴露的 PLC,远程访问应经 VPN 或网关。
意义:关键基础设施 OT 暴露面风险上升
xAI 于 2026 年 7 月 31 日发布 Imagine Video 1.5 更新:支持文本直接生成视频、图像与声音参考,以及最高原生 1080p 输出;图像参考、文本生成视频和 1080p 已上线 xAI API。
意义:视频生成进入可控一致性阶段
Microsoft Research 发布 Echoverse:构建 12 个可重置、带真实状态与数据库验证器的训练环境,用于训练电脑操作智能体。其 9B 模型在 14 个评测划分上从 36.5% 提升至 67.1%,并开源 4 个环境、代码、数据和验证器;结果为作者报告。
意义:为电脑操作智能体提供可复现训练基座
OpenAI 发布十项由其内部 Astra 模型取得的数学与理论计算机科学结果,覆盖球堆积、量子复杂性、格密码与组合数学;公司称已将论证整理为论文并提供 Lean 形式化证书。
意义:AI 研究协作走向可验证证明
OpenAI 宣布 GPT-5.6 Luna 输入/输出价格下调 80%,Terra 下调 20%;Sol 新增 Fast 模式,官方称其最高可达标准处理速度的 2.5 倍,价格为两倍。
意义:模型推理成本与延迟继续下探
OpenAI 7 月 31 日披露:GPT-5.6 Luna 输入/输出价格下调 80%,Terra 下调 20%;其称服务端软件优化将端到端成本降低 20%,推测解码效率提升逾 15%。这些均为公司自述。
意义:AI 规模化成本继续下探