TeleTune 从使用日志中推测每段会话的目标,让模型借助文本技能库预测用户的下一步操作;只有能提高留出日志预测准确率的技能修改才会保留。材料称,旧日志上的下一步预测准确率与实际环境中的成功率变化一致,但未给出具体实验数字。
全部 AI 动态
10月9日
研究中,98名患者在就诊前使用了研究级诊断AI聊天机器人AMIE,监督医生实时监控全部交互,按预设安全标准没有对话需要中断。临床医生反馈,AI摘要在75%的场景下帮助他们提前准备接诊;研究仍需更大规模临床试验,才能评估面向患者的表现。
MirroS团队发布AgentGarten,将代码控制的物理环境与实时神经渲染器连接,让智能体根据画面行动,并把每轮经验写入手册供下一轮使用。在一对一捉迷藏实验中,躲藏者第4轮学会搭掩体,搜寻者第10轮学会借坡道翻墙;团队还报告了另外四类任务在四轮演练中的进展。
一则帖子称,OpenAI 撤回了两天前发表的一篇数学论文的部分内容。材料未说明撤回涉及哪些内容。
一则对 NVIDIA 论文的介绍称,VERA 将基准测试转为逾 9,000 个可重启的沙盒,依据真实文件和日志逐步评分。在所述医疗研究基准测试中,9B 智能体同时采用模型训练和技能文件修改得分为 69.1,分别只采用其中一种方法时得分为 43.3 和 56.1。
VERA 将长任务拆成可逐步核查的环节,利用真实文件和日志评分,再决定下一轮改进模型还是技能文件。在一项医学研究基准测试中,9B 智能体采用两种更新方式得分 69.1,仅修改技能文件为 56.1,仅训练模型为 43.3。
OpenAI 本周发布数百份由模型生成的数学难题解答。剑桥大学和伦敦国王学院研究人员在其中一项解答的自然语言证明与 Lean 代码之间发现至少两处出入;这些出入未必推翻解答,但说明证明仍需人工审查。
10月8日
PaperBenchX将93篇论文转为跨12个研究方向的复现任务,要求AI提交可在隔离环境中重新运行的工作流。该测评中,表现最强的GPT-6 Astra完整复现率为13.98%;团队已开放12个任务,其余81个保持封闭。
PivotOPD 在训练中识别可能让任务失败的关键动作,并教智能体在犯错后继续完成任务。在 72 个关键错误的重复测试中,其恢复率为 72.7%,标准在策略蒸馏方法为 20.3%;该方法需要可重放的测试环境,代码尚未发布。
一篇新论文指出,聊天机器人可能在把错误的数学证明转写为 Lean 证明时,悄悄修正错误,使结果通过检验,却无法证明原始自然语言证明正确。相关介绍还称,判断一个陈述能否被忠实翻译,比停机问题更难,因此不存在总能做到这一点的 AI 翻译器。
NAT-ARC先用ImageNet自然图像预训练视觉编码器,再针对ARC格子题训练,并在测试时对每道题单独微调。报道给出的ARC-1成绩为:最佳单模型pass@2达63.4±0.7%,集成模型达70.2±0.6%;集成结果包含不同预训练策略的模型。
研究者提出 Normalizing Trajectory Models(NTM),用条件归一化流建模图像生成的每一步,并以精确似然训练。论文称,在文生图基准测试中,该方法仅用四步采样就达到或超过强基线,同时保留生成轨迹的精确似然;材料未给出具体分数。
约三分之一天空从未接受紫外线观测。研究人员整合已有观测数据,并借助 Claude Science 参考可见光、红外和无线电数据估算空白区域;地图区分实测与预测区域,并标注预测的不确定性。
天津大学姜忠义、何光伟团队将单晶 COF 嵌入聚合物膜,填充量达到 75.5% 的体积分数。在模拟烟气混合气测试中,该膜的二氧化碳渗透率达到 74,800 Barrer,二氧化碳/氮气选择性约为 20;初步技术经济分析估算,在设定流程与成本条件下,碳捕集成本约为每吨二氧化碳 38 美元。
10月7日
据量子位报道,瑞典皇家科学院将2026年诺贝尔化学奖授予Henri B. Kagan和Kenso Soai,表彰两人在不对称有机合成中发现非线性效应与自催化。报道提及,Soai在1995年的实验中,将一种镜像分子起初2%的领先优势放大至87%。
这项研究提出 JAZ:让智能体把提示词和完整历史记录作为变量,在调用子智能体时直接传递。材料称,在需要回溯 50 多项任务的 StuLife 测试中,JAZ 的通过率为 69.9%,Letta 为 61.8%,且 JAZ 成本不到其一半;这些是论文报告的结果。
循环语言模型会让每个词元多次经过同一组网络层,增加缓存占用。论文提出保留最近 128 个词元的完整缓存,将更早的词元压缩为可供各轮直接读取的小向量。在 Ouro 模型的 16K 词元测试中,吞吐量最高提升 7.4 倍,数学、知识和推理任务的准确率保持在原模型的 97% 以上。
OpenAI公开了由尚未发布的内部模型产出的722篇数学手稿,归为372组结果,并上传论文、源码和部分Lean证明。手稿涉及黎曼ζ函数无零点区域及霍奇猜想的特定情形等问题;仓库称各项结果核验进度不同,部分尚无Lean形式化证明。独立顾问组表示,参与提供建议不代表认可这些结果。
展开进展与来源
一则帖子称,OpenAI 发布了722份AI生成的数学证明,相关论文涉及372项数学成果。其中一项矩阵乘法结果将两个 n×n 矩阵相乘的已证明复杂度上界从约 n^2.371177 降至约 n^2.25,并附有 Lean 形式化证明;这仍是理论界限,尚不能直接用于加速实际 GPU 工作负载。
同一事件,精选展示《OpenAI公布未发布模型生成的数学研究成果》展开进展与来源
这批文件包含722份手稿,涵盖372个结果家族;咨询小组AGMAI称,其中有对“数百个”未解决问题的解答。发布资料还包括部分推理摘要和算力消耗估算,但数学家仍需评估这些成果,完整影响尚不明确。