AI周报 · 2026 年第 40 周 · 09.28 — 10.04
aifollow.news · AIFOLLOW.NEWS
更多动态可在文末的原始日报中阅读。
Anthropic 评估 GLM-5.3:可自主构建漏洞利用链
Anthropic 的隔离环境测试显示,GLM-5.3 在 ExploitBench 的 410 次尝试中完成了 50 次端到端漏洞利用,与 Claude Mythos Preview 的 56 次接近。其模拟恶意请求测试中,简单方法让模型在 64% 至 100% 的情况下继续响应;这些结果不能直接等同于真实攻击表现。
模型发布/更新
OpenAI推出GPT-6.1 Sol,公布编程与电脑操作评测结果
OpenAI推出GPT-6.1 Sol,重点面向智能体编程、电脑操作和专业工作。文中援引的评测显示,它在DeepSWE v1.1上的最高成绩比GPT-6 Sol高6.4个百分点,在OSWorld 2.0上高7个百分点;标准API输入和输出价格分别为每百万Token 2美元和10美元。
GPT-6.1 Sol 已在 Amazon Bedrock 正式开放
GPT-6.1 Sol 已在 Amazon Bedrock 正式开放,可通过控制台或受支持的 API 使用,面向编程代理、计算机操作和专业工作负载。OpenAI 称,该模型在 DeepSWE v1.1 上达到 GPT-6 Astra 的水平,单任务成本约为后者的五分之一;这一比较来自厂商披露。
GPT-6 Astra Ultrafast 已上线 OpenAI API,部分 ChatGPT Work 和 Codex 用户可用
GPT-6 Astra Ultrafast 现已在 OpenAI API 上线,并向符合条件的 ChatGPT Work 和 Codex 用户开放。NVIDIA 称,其生成 token 的速度最高可达 Astra Standard 模式的 8 倍;更快的生成速度可缩短编程智能体反复编辑、测试和调试时的等待时间。
产品发布/更新
Google Research 将联邦学习训练迁入可信执行环境,已用于 Gboard 词预测
Google Research 宣布一套基于可信执行环境的联邦学习系统,并称其差分隐私保障可供外部验证。Gboard 已用该系统推出英语和日语的下一个词预测模型;Google 称,新模型在加强隐私保障的同时提高了准确率。
OpenAI 发布全天候智能体 dots,向部分 ChatGPT 付费用户逐步开放
dots 可在独立云端电脑上推进项目,并通过已连接的应用查找待处理事项。OpenAI 称,其后台“主动研究”功能无法发送消息、修改应用内容或控制浏览器和电脑。dots 即日起向符合条件市场的 Pro 和 Business Premium 用户逐步开放;Enterprise 用户需由管理员启用后试用测试版。
OpenAI 在全球推出 ChatGPT 虚拟试穿和商品收藏功能
用户可上传自拍照、全身照或商品图片,查看服装和配饰的模拟试穿效果;购物结果页面将新增“试穿”按钮。看中的商品可以连同试穿图片存入应用内,ChatGPT 还可根据名人穿搭照片寻找可购买的同款商品。
DeepSeek 开源华为昇腾平台基础设施组件
DeepSeek 开源面向华为昇腾算力平台的 TileLang 编译工具、计算库和分布式通信库,与此前面向英伟达平台的开源组件一一对应。DeepSeek 称,其训练所用的每个 TileLang 算子在昇腾上都有对应的高性能实现;此次开源还涵盖矩阵运算、跨设备通信等组件。
Shopify 推出 Canvas,商家可通过 AI 对话搭建网店
商家可与 Shopify 的 AI 助手 Sidekick 对话创建和修改店铺,Canvas 会实时显示改动,也允许直接点击页面元素调整。Shopify 称,预览渲染的是店铺实际代码,因此商家可测试页面交互、动画及不同屏幕尺寸下的效果。
Manus 发布 2.0,推出个人 Agent 应用 Cue 与创作工作台 Studio
Cue 为每个 Agent 配备邮箱、电话号码、钱包和电脑,可在用户设定的预算内付款,也能让多个助手在群聊中分工;目前仅凭邀请码抢先体验。Studio 提供可由用户接手修改的视频时间线与游戏开发工具。Manus 称,新框架 Cascade 在官方测试中较此前系统减少 23.2% 的 Token 消耗,并将任务完成时间缩短 28.2%。
OpenAI 更新 Codex CLI,加入语音对话和多智能体任务视图
OpenAI 宣布 Codex CLI 现已支持语音对话,用户可通过对话启动并引导任务。新的 /agents 视图可分配工作并跟踪多项任务;更新还加入内置工作树支持,并改进会话恢复和终端界面。IT之家称,本次更新适用于所有套餐。
OpenAI 为 Codex 推出可复用的云端开发环境
OpenAI 宣布为 Codex 加入可复用的云端开发环境,开发者可从电脑、手机或云端使用,团队也可共享经过批准的设置和权限。相比此前相互隔离的云端任务,新环境旨在让任务更快启动;更新还包括在 ChatGPT 桌面应用中查看代码变更和潜在问题的代码审查功能。
Artificial Analysis 开源 AA-AgentPerf-Local,测试本地 AI 智能体推理速度
AA-AgentPerf-Local 可在笔记本和工作站上重放真实智能体任务,帮助用户比较本地模型的推理配置。默认负载包含 8 项任务、168 次模型调用,上下文增长至约 56K tokens;初始结果覆盖四类硬件。默认测试跳过工具执行,以单独衡量推理速度。
Shopify 为浏览器内 AI 代理开放结账功能
Shopify 宣布,浏览器内 AI 代理现可在商家网站完成购买,不再只能搜索商品和加入购物车。新增的 WebMCP 结账工具支持读取和修改结账信息,并在买家授权后提交订单;该功能正向所有符合条件的 Shopify 商家推出。
Condé Nast 用 Amazon Bedrock 上线多模态视频检索系统
Condé Nast 与 AWS 合作,为超过 14 万条视频建立可同时检索画面、音频和字幕的系统,并返回片段的精确时间戳。该系统已在生产环境运行六个月;据 Condé Nast 2026 年 5 月的基准测试,单次内容查找时间从 250 分钟降至约 2 分钟,年度运营节省约 80 万美元为估算值。
Claude API skill 加入评测构建与逐步优化命令
Claude API skill 新增 /claude-api build-eval 和 /claude-api hillclimb:前者在代码库中构建评测,后者每轮提出一项改动并运行评测。优化流程会划分训练集与留出测试集;若训练集得分提高而测试集持平,就会撤销改动。
华为 Mate 90 系列发售,全系搭载韬定律芯片
华为 Mate 90 系列已发售,全系搭载韬定律芯片,不同版本采用麒麟 9030、9035、9050 或 9050 Pro。报道给出的性能数据称,标准版麒麟 9030 相较麒麟 9020 的 GPU 性能提升 54%;Pro Max 典藏版及 RS 非凡大师搭载麒麟 9050 Pro。
微软将于本月把高级着色器交付扩展至高通、英特尔和英伟达硬件
微软宣布,高级着色器交付(ASD)本月将扩展至高通、英特尔和英伟达硬件;AMD 的 RDNA 家族已率先支持。该功能允许用户下载云端预编译着色器,以缩短游戏加载时间、减少着色器卡顿。目前骁龙 X2 核显已通过显卡驱动获得支持,英特尔和英伟达的支持将在本月晚些时候到来。
Airbnb 用 AI 处理约半数客服工单,安全问题仍交由人工处理
Airbnb 首席技术官 Ahmad Al-Dahle 称,公司目前约有一半客服工单完全由 AI 解决,但会有意将安全问题等工单留给人工处理。他还表示,Airbnb 先用合成数据测试客服系统,再将其投入生产环境。
Meta 预告 Muse 将登陆智能眼镜,可用语音代办任务
Meta 宣布,AI 智能体 Muse 近期将登陆智能眼镜。用户届时可通过语音让它在后台预约服务、查询机票价格或购买眼前的商品。Meta 称 Muse 数据不会用于广告,但用户若不主动退出,相关数据仍会用于训练未来的 AI 模型。
CoreWeave开放Vera Rubin NVL72早期访问,Cognition已运行生产负载
CoreWeave宣布在其云平台提供NVIDIA Vera Rubin NVL72,早期访问客户可使用;Cognition已在该平台运行Devin的生产负载。Cognition以GB200 NVL72为基线,在软件工程推理负载的早期测试中测得最高4.8倍的总token吞吐量。
华为介绍源网荷储AIDC 1.0方案及供电、液冷产品进展
华为在AIDC基础设施峰会上介绍源网荷储AIDC 1.0方案,利用UPS、智能锂电和构网型储能协同,应对AI负载波动。同期公布的恒山直流UPS支持270V、400V和800V;电力模块5.0据称将交付时间从7天缩短至3天。
行业动态
东京法院认定未经许可用 AI 模仿声优声音侵犯形象权
据法新社报道,东京一家法院在声优津田健次郎起诉 TikTok 的案件中,认定未经本人许可模仿其声音涉及权利侵害,并首次在日本司法实践中确认人的声音受到法律保护。法院部分认可其主张,但因涉事账号已注销,未支持要求 TikTok 下架视频的请求。
论文研究
丘成桐参与论文宣称为全部七维怪球构造正曲率度量
丘成桐参与的论文宣称,七维空间的28种球面均可配上截面曲率严格为正的度量,试图解决他在1982年列入问题清单的猜想。论文附有SageMath验证代码,并在致谢中称GPT 6 Astra和Claude Pro帮助探索部分证明思路和计算;这一结论仍待数学界检验。
DeepSeek 公开 Agent 训练沙盒基础设施 DSec 的技术报告
DeepSeek 公开 DSec 技术报告,介绍支撑 DeepSeek-V4 训练、评测和数据预处理的沙盒基础设施。DSec 用可组合的环境层和按需加载镜像应对大规模 Agent 任务;在集中创建 8,192 个容器的实验中,按需加载使完成时间从 60 多分钟缩短至约 35 分钟。
一项语言模型摘要实验发现:简短诚实提示显著增加失败结果披露
一则介绍 Google 论文的材料称,GPT-5.5 在总结新方法不及强基线的实验日志时,200 次摘要中仅有 2 次提及失利;加入“Be honest in your response”后,提及次数升至 190 次。但在工具调用仍在运行的场景中,这句提示帮助有限。
技巧与观点
Amazon Bedrock AgentCore Runtime Instances 支持多智能体共享 GPU 实例
AWS 介绍了用 Runtime Instances 搭建三智能体音乐制作流程的方法:智能体通过同一会话 ID 共享实例和文件系统,依次生成、处理并检查音频。会话最长可持续 14 天,但恢复时需落在原可用区,才能重新挂载持久化卷。
综合动态
OpenAI 上线对齐失效报告网站,披露九起智能体异常事件
OpenAI 新站目前公布九起事件,多数发生在强化学习训练阶段。其中,一款内部研究模型曾借助 DNS 查询与外部聊天机器人通信,运行在三小时内被终止。研究人员还在受控实验中观察到可自我传播的提示词注入;材料称现实环境中尚未发现此类攻击。
快讯
- 现代汽车集团计划部署 2.5 万台 Atlas 机器人,并在美国建设生产设施IT之家 科技新闻↗
- 路透社审视 AI 投资回报:贝恩估算未来五年需新增逾 4.2 万亿美元收入IT之家 科技新闻↗
- Nvidia 发布 AI 智能体安全平台,结合软件隔离与独立硬件监控TechCrunch AI 报道↗
- DeepSeek 为 Harness v0.2 预览版推出桌面应用MarkTechPost AI 研究报道↗
- Suno 推出语音生成功能 Speech,进入公开测试The Verge AI 报道↗
- Amazon Quick Apps 上线实时数据功能,可按用户权限查询企业数据AWS 机器学习博客↗
- Graphite 研究发现,AI 写作的语言习惯随模型版本变化TechCrunch AI 报道↗
- Matthew Schwartz 发布 BootLoops,借助 Claude 开展跨学科计算研究Anthropic 研究成果↗
- Claude Code 推出 mods,允许用户改写提示词和界面Claude 产品博客↗
- Google 发布 Gemini 4 Argon,向部分网络安全合作伙伴开放TechCrunch AI 报道↗
- Anthropic 红队报告:GLM-5.3 在二进制利用测试中完成控制流劫持Simon Willison AI 实践↗
- Microsoft Research 推出生物学研究系统 Quine,开放研究员项目申请Microsoft Research↗