Odyssey-3 可根据用户移动视角、采取动作或触发事件后的输入,预测生成环境如何变化。预览版支持第一人称、第三人称导航和独立相机移动;据 Odyssey 发布的信息,Pro 版在 Physics-IQ Verified 视频到视频测试中取得 66.1 分,创该榜单最高纪录。
同一事件,精选展示《Odyssey 发布世界模型 Odyssey-3,Flash 版本已开放免费体验》全部 AI 动态
10月9日
Ultrafast 正面向 API、Codex 和 ChatGPT Work 推出。材料称,其速度最高可达 Sol Standard 的 8 倍,费用则为 6 倍;“最高”速度并不代表每次使用都能达到这一水平。
同一事件,精选展示《GPT-6.1 Sol Ultrafast 开始推送,模型指令调整响应也获改进》展开进展与来源
GPT-6.1 Sol Ultrafast 当天开始向 API、Codex 和 ChatGPT Work 推送。发布方称,它的速度最高可达 Sol Standard 的 8 倍,智能水平接近 Astra;另称模型现在能更快响应用户对方向的实时调整。
展开进展与来源
Odyssey-3 根据先前画面和输入动作预测后续画面,让生成的场景随操作变化。其 Flash 版本可从文字提示生成可探索的世界,材料称任何人现在都能免费试用;Pro 版本在 Physics-IQ Verified 视频转视频评测中取得据报最高的 66.1 分。
展开进展与来源
Odyssey-3 根据先前画面和输入动作预测后续画面,使场景能随操作变化。Odyssey 称,精简版 Odyssey-3 Flash 已可免费体验;Pro 版在 Physics-IQ Verified 视频到视频评测中的报告得分为 66.1,但材料未给出独立验证信息。
同一事件,精选展示《Odyssey 发布世界模型 Odyssey-3,Flash 版本已开放免费体验》展开进展与来源
JetBrains 发布 Mellum2.1,这款 12B 参数的混合专家模型每次处理 token 时激活 2.5B 参数,权重以 Apache 2.0 许可发布。JetBrains 自报的统一评测中,它的 SWE-bench Verified 得分从前代的 2.0 升至 47.0,但仍低于 Qwen3.5-9B 的 50.0。
10月8日
Preferred Networks 发布 PLaMo 3 Translate 31B,支持的语言从上代的日语和英语扩展至 53 种,并加入覆盖 15 种语言的在线会议翻译模式。PFN 称其在四项翻译基准测试中的平均分超过 GPT-6.1 Sol 和 GPT-6 Astra;输入价格为每 10 万字符 14 日元。
这两款模型分别为 0.6B 和 9B,可在同一嵌入空间检索文本、图片和渲染后的 PDF 页面。权重已在 Hugging Face 以 MIT 许可发布,需自行托管;Perplexity 托管的 API 尚未上线。其公布的 9B 模型 MADQA 得分为 92.4%,但成绩均为自行报告,技术报告也尚未发布。
OpenAI安排从10月8日起向ChatGPT免费和Go用户逐步推送GPT-6 Luna,付费用户则陆续用上GPT-6 Sol。新版聊天界面可按问题生成可交互的图示和工具;部署安全报告同时显示,Luna在部分未成年人安全评测中较上一代退步。
展开进展与来源
OpenAI 宣布向所有 ChatGPT 用户推出 GPT-6 系列模型及智能界面。新界面可按问题组合文字、图像和交互组件生成回复,例如用可互动的视觉内容教用户打麻将。此前,GPT-6 Astra、Sol 和 Luna 仅供 ChatGPT Work 和 Codex 使用。
展开进展与来源
Liquid AI 发布 d1-3B 和 d1-omni-600M,分别支持文本与图像、文本与图像或音频输入。它们一次计算便对预设选项返回概率,不生成文字,适用于请求分类、内容审核等任务。两款模型的权重已上架 Hugging Face;许可允许年收入低于 1000 万美元的企业免费商用。
10月7日
Falcon-ASR 重点识别阿联酋方言,也支持英语、法语、西班牙语和葡萄牙语。TII 称,其在六组阿拉伯语测试中的平均词错误率为 20.92%,所用榜单快照中的最佳已发表结果为 23.17%。目前可通过 Hugging Face 演示体验,API 接入和原生应用仍在计划中。
@smallest_AI 的 Pulse 在 Voice Arena 的说话人识别与转录赛道中,以 24.4% 的说话人识别错误率位列七个系统之首;第二名 ElevenLabs Scribe v2 为 40.7%。该测试使用真实对话的远场录音作为输入,并依据每位说话者的独立麦克风录音制作标注。
谷歌发布图像生成与编辑模型 Nano Banana 2.1,并称新版在视觉设计、蒙版编辑和主体一致性方面有所改进。用户可选中并修改图片局部,无需重生成整张图;模型正逐步上线 Gemini 应用、谷歌搜索的 AI 模式等产品。
Musubi 发布用于实时内容审核的轻量级决策模型 PolicyLM-1.7B,并开放模型权重。该公司称,模型可依据普通英语写成的规则,在 50 毫秒内判断一条消息是否属于指定类别;规则变动时无需重新训练模型。
10月6日
Mistral AI 首席执行官 Arthur Mensch 表示,公司将在今日发布新的人工智能模型,并声称该模型在网络安全等某些方面优于中国模型。他没有说明具体比较对象,也未明确网络安全以外的优势领域。
Reka 发布了从零训练的 19B 参数模型 Rho-1。该模型可处理文本、图像和视频,并输出机器人动作;Reka 展示了一段无需调用工具或其他模型、在五轮交互中完成绘图、动画和视频编辑的过程。目前仅能通过邮件申请研究预览,尚无公开权重、API 或定价。
Reflection AI 推出首款开放权重模型 Beam,瞄准代码编写和智能体任务。该公司称,Beam 的性能可对标 GLM‑5.2,在代码和智能体任务上的表现正逐步逼近 Qwen3.8‑Max;模型总参数量为 5010 亿,每次任务激活 230 亿。
10月5日
Axios 报道称,Reflection 等多家西方企业计划本月推出开放权重 AI 模型。此类模型支持客户本地部署,对微调和推理数据安全要求严格的行业有吸引力;报道预计,Reflection 的新模型初期仍将落后于美国竞争对手最先进的闭源模型。Reflection 发言人拒绝置评。
10月2日
AstaBrief 8B 可把研究问题和检索到的文献摘录写成带引文的报告,现已用于 Asta 的 Fast 模式,模型权重和训练数据也已公开。在 Asta 整套流程中,Fast 模式平均每份报告耗时 51.1 秒,Thinking 模式为 178.5 秒;相关评测主要完成于 2025 年,尚未针对当前前沿模型重新进行完整评测。