AI周报 · 2026 年第 41 周 · 10.05 — 10.11
aifollow.news · AIFOLLOW.NEWS
更多动态可在文末的原始日报中阅读。
OpenAI公布未发布模型生成的数学研究成果
据报道,OpenAI公布了一批由尚未发布的前沿模型生成的数学问题解答,共涉及722份文稿、372组相关成果。独立顾问团AGMAI称,其中包括对“数百个”开放问题的解答。
模型发布/更新
GPT-6开始向ChatGPT用户推送,免费用户将用上Luna版
OpenAI安排从10月8日起向ChatGPT免费和Go用户逐步推送GPT-6 Luna,付费用户则陆续用上GPT-6 Sol。新版聊天界面可按问题生成可交互的图示和工具;部署安全报告同时显示,Luna在部分未成年人安全评测中较上一代退步。
Odyssey 发布世界模型 Odyssey-3,Flash 版本已开放免费体验
Odyssey-3 根据先前画面和输入动作预测后续画面,让生成的场景随操作变化。其 Flash 版本可从文字提示生成可探索的世界,材料称任何人现在都能免费试用;Pro 版本在 Physics-IQ Verified 视频转视频评测中取得据报最高的 66.1 分。
GPT-6.1 Sol Ultrafast 开始推送,模型指令调整响应也获改进
GPT-6.1 Sol Ultrafast 当天开始向 API、Codex 和 ChatGPT Work 推送。发布方称,它的速度最高可达 Sol Standard 的 8 倍,智能水平接近 Astra;另称模型现在能更快响应用户对方向的实时调整。
PFN 发布 PLaMo 3 Translate 31B,翻译语言扩至 53 种
Preferred Networks 发布 PLaMo 3 Translate 31B,支持的语言从上代的日语和英语扩展至 53 种,并加入覆盖 15 种语言的在线会议翻译模式。PFN 称其在四项翻译基准测试中的平均分超过 GPT-6.1 Sol 和 GPT-6 Astra;输入价格为每 10 万字符 14 日元。
谷歌发布 Nano Banana 2.1,改进局部编辑与主体一致性
谷歌发布图像生成与编辑模型 Nano Banana 2.1,并称新版在视觉设计、蒙版编辑和主体一致性方面有所改进。用户可选中并修改图片局部,无需重生成整张图;模型正逐步上线 Gemini 应用、谷歌搜索的 AI 模式等产品。
产品发布/更新
OpenAI 将在欧盟为 ChatGPT 和 Codex 生成的文本添加隐形水印
OpenAI 称,未来几周将在欧盟向所有套餐的符合条件用户逐步推出文本水印;全球 API 开发者今天起可为部分模型手动开启,默认仍关闭。水印可随复制的文本保留,但改写会削弱检测:在一项测试中,替换 10% 的词后,检出率从约 92% 降至 66%。检测工具初期仅向获批研究人员和专业机构开放。
Google Cloud 发布面向企业工作的 Gemini agent
Google Cloud 宣布推出 Gemini agent,可在同一入口处理问答、知识工作、媒体创作和代码任务。材料称,它目前可在 Gemini 和 Anthropic Claude 模型之间调度任务;企业还可设置项目支出上限,触发后代理会暂停,直到有人恢复运行。
微软公布 Nvidia 芯片 Surface 新机价格,并预告 Windows 11 智能体隔离功能
微软公布 Surface Laptop Ultra 的配置与价格:两个基础型号分别起价 2,600 美元和 3,700 美元,另有起价 6,000 美元的 Surface RTX Spark Dev Box。两款设备主打在本地运行 AI 模型;微软称,新版 Windows 11 的“Execution Containers”可帮助隔离 AI 智能体,且该功能将面向所有 Windows 11 用户。
Anthropic 为 Claude 推出数据仪表板和解释性动画功能
Anthropic 宣布 Claude 新增两项测试功能:连接公司数据平台后,用户可用自然语言创建自动更新的监控仪表板;还可将文字、图表等素材制作成短动画。仪表板面向所有付费套餐用户开放,动画功能仅面向 Team 和 Enterprise 用户。
Meta Muse 与 OpenAI Dots 面向大众推出 AI 代理,价格和使用门槛不同
The Verge 对比 Meta Muse 与 OpenAI Dots:两款代理都主打代办订餐等多步骤任务,Muse 免费,Dots 面向每月付费 100 美元及以上的订阅用户,并提供营销、法律等专项版本。记者仍在测试两者,称尚无法放心让它们独立完成重要的日常任务;授权邮箱、信用卡等数据也带来隐私顾虑。
Anthropic 启动网络安全计划,推出免费开源代码扫描服务
Anthropic 启动 Cyber Mission,面向关键基础设施防护机构提供 Claude 模型、驻场工程师和威胁研究支持;同时推出自愿加入的 OSS Scanner,为开源项目免费定期扫描漏洞。扫描报告未经人工审核,项目维护者仍需核查结果。
微软宣布让 Copilot 将部分编码任务交给本地 MAI-Code-1.1-Flash
微软宣布,Copilot 可将部分编码任务交给在 PC 上运行的 MAI-Code-1.1-Flash,调用本地模型不收推理费。该模型保留 256K token 上下文窗口;微软称其量化版本在两项编码评测中与全精度版本得分相同。微软还宣布,Windows 11 上的代理沙箱 MXC 已全面开放。
NVIDIA 与 Microsoft 发布 RTX Spark Windows 电脑,笔记本现可预订
RTX Spark 将 NVIDIA AI 软件栈带入 Windows 笔记本和紧凑型台式机,可在本地运行 AI 模型。笔记本现已开放预订,预计 10 月 16 日上市;紧凑型台式机预计 11 月开售。Microsoft 同时宣布,供 AI 代理在 Windows 后台运行的 Microsoft Execution Containers 已正式可用。
微软展示 Copilot 升级:可访问电脑本地文件并跨 Windows 执行操作
微软在 Windows 和 Surface 活动上展示了 Copilot 升级,称其将能访问电脑本地文件并跨操作系统执行操作。演示中,微软高管让 AI 代理协助处理报税相关事务;材料没有说明这些能力何时、向哪些用户开放。
谷歌与 Unity 推出 AI 游戏平台 Playground,支持用文字提示创建游戏
谷歌宣布与 Unity 合作推出实验性平台 Playground。用户可通过对话输入提示词生成游戏初稿,再调整物理效果、规则和角色;平台可在电脑和手机浏览器中使用,作品可分享给他人或发布到 Explore 展示页。与 Unity Spark 的集成及更强的 3D 开发能力仍属未来计划。
OpenAI 将为 ChatGPT 自动识别未满 18 岁用户并启用青少年体验
OpenAI 更新支持文档称,ChatGPT 将根据账户使用信号预测用户年龄,并为被识别为未满 18 岁的用户开启青少年体验,限制部分敏感内容和交互。被误判的成年人可通过 Persona 提交实时自拍或身份证件验证年龄,确认后移除保护措施。
GPT-6 Astra 与 GPT-6.1 Sol 默认速度据称提升约 50%
一则被引用的更新称,订阅用户在相关产品及使用 Sign in With ChatGPT 的合作伙伴产品中,使用 GPT-6 Astra 和 GPT-6.1 Sol 时默认速度将提升约 50%。用户无需调整设置,效果预计在发布后两小时内显现。
TikTok 推出 AI 购物助手和信息流一键结账功能
TikTok 宣布推出购物助手,可在对话中回答商品详情、配送、尺码和库存等问题,并协助完成购买。用户还可从 For You 信息流一键向品牌购买商品;TikTok 称这些功能正与 Shopify、Stripe 等合作伙伴共同开发。
行业动态
Common Sense Media称ChatGPT for Teens在危机对话中仍鼓励青少年继续聊天
Common Sense Media的测试发现,ChatGPT for Teens在部分心理危机对话中仍邀请青少年继续交流;当风险涉及青少年与聊天机器人自身的关系时,它很少引导他们求助成年人。OpenAI质疑测试方法,称部分测试可能发生在家长控制功能完全启用之前。
OpenAI 发布首份青少年使用报告,家长安全提醒遭测试质疑
OpenAI 称,青少年用户平均每天使用 ChatGPT 不足 15 分钟,连续使用超过 3 小时者占比不到 2%。Common Sense Media 用十多个测试账号发现,涉及自杀、自伤或进食障碍的对话未能及时触发家长提醒;OpenAI 回应称,账号关联及提醒功能生效可能需要数小时。
论文研究
天津大学团队研制高填充量碳捕集膜,模拟烟气测试显示高渗透率
天津大学姜忠义、何光伟团队将单晶 COF 嵌入聚合物膜,填充量达到 75.5% 的体积分数。在模拟烟气混合气测试中,该膜的二氧化碳渗透率达到 74,800 Barrer,二氧化碳/氮气选择性约为 20;初步技术经济分析估算,在设定流程与成本条件下,碳捕集成本约为每吨二氧化碳 38 美元。
Parsewave 发布 AutomationBench Verified,修复 206 个任务判分错误
Parsewave 审查了 Zapier 的 AutomationBench 全部 600 个公开任务,经人工确认并修复 206 处判分错误。用修复前后的判分器重评 1,235 次 Kimi K3 运行时,344 次(27.9%)得到不同结果,显示基准测试的评分方式会影响模型成绩。
快讯
- Reka 推出 Rho-1 研究预览版,可在同一模型中生成视频与机器人动作MarkTechPost AI 研究报道↗
- 2026年诺贝尔生理学或医学奖授予三位光遗传学研究者量子位 AI 报道↗
- 微软论文提出用软件使用日志改进智能体技能Rohan Paul (@rohanpaul_ai)↗
- Google 与 BIDMC 研究人员在98名患者就诊前测试诊断AI AMIE量子位 AI 报道↗
- Windows 11 预览版搜索支持直接更改系统设置,离线测试可用IT之家 科技新闻↗
- MirroS发布AgentGarten,让智能体在可交互世界中反复试错量子位 AI 报道↗
- OpenAI 推出基于 GPT-6 Luna 的 Decisions APIginobefun (@hongming731)↗
- Voyager 推出面向创作软件的 macOS AI 助手Rohan Paul (@rohanpaul_ai)↗
- OpenAI 发布数百份数学难题解答,研究指出证明转换存在出入TechCrunch AI 报道↗
- JetBrains 发布面向编程代理的 Mellum2.1 模型MarkTechPost AI 研究报道↗
- Goodfire 推出监测 AI 智能体内部信号的安全工具TechCrunch AI 报道↗
- UniPat AI发布PaperBenchX,测评AI复现科学论文的能力量子位 AI 报道↗