aifollow.news Search
Back 量子位 AI 报道
量子位 AI 报道· · Original publication time Selected

Kaiming He’s team proposes VISTA, a visual reasoning framework that lets multimodal models revisit past imagesMachine translation

Automatically verified and published · Generated and evidence-checked automatically; not reviewed by a human.

AI-assisted summary

VISTA stores original images from an interactive task outside the model’s context, letting existing multimodal models retrieve, enlarge and compare them during reasoning without additional training. In the reported experiments, pairing it with GPT-5.6 Sol raised success on GameWorld’s 170 tasks from 40.0% to 63.3%; tasks closer to the physical world remain a future research direction.

Why it matters

这项研究给出了让现有多模态模型回看视觉经历的具体方法,并报告了同一模型在游戏任务上的对比结果;其效果尚未在更接近物理世界的任务中验证。

Article · Original

The article text is unavailable in this language; an existing version is shown.

多模态模型的视觉原生Harness,来了!

henry 发自 凹非寺

量子位 | 公众号 QbitAI

henry 发自 凹非寺

量子位 | 公众号 QbitAI

多模态模型的视觉原生Harness,来了!

最近,何恺明团队在最新论文《VISTA: A Visual Harness for Reasoning in an Interactive World》中,提出了一套视觉原生的Harness——

VISTA 。

它让现有的多模态模型直接观察环境、保存原始画面,并在推理时随时回看、放大和检查细节,无需从头训练。

相比于传统将环境抽象成文字或代码的做法,VISTA保留了 原始的视觉信息 。模型可以根据眼下的问题,将过去看过的画面重新调入上下文,参与当前的判断与推理。

基于这套方法,视觉经验成为了模型随时调用、反复检查的上下文,而多模态模型,也有了围绕视觉记忆搭建的原生脚手架。

在评测方面,搭配VISTA,Claude Opus 5.0完成了ARC-AGI-3全部25个公开游戏,相对人类动作效率得分达到满分 100 ,所用游戏动作数比首次游玩的人类基线少 57.4% 。

换成GPT-5.6 Sol,同样全部通关,得分达到99。

更进一步,团队还在浏览器游戏、迷宫和连线题中验证了这套方法,并将更接近物理世界的具身任务列为后续研究方向。

这是怎么做到的?

从ResNet、Mask R-CNN到MAE,视觉感知与表征学习始终是何恺明研究的一条主线。

这一次,VISTA将目光投向了一个新问题:如何让模型在持续交互中积累、保存并利用视觉经验?

答案是 Harness 。

去年11月,Anthropic曾以长时间编程任务为例,介绍了Harness如何帮助模型跨越多个上下文窗口,持续推进任务。

具体来说,Harness会通过任务清单记录尚未完成的事项,通过进度文件和代码记录保存已经完成的工作。

这样一来,即使模型进入新的上下文窗口,也能通过读取这些信息,了解此前做了什么、接下来该做什么。

复杂任务由此可以分步执行、检查结果,并在不同上下文窗口之间接续工作。

可以说,这套主要通过文字和代码来保存任务状态的Harness,在一定程度上推动了这一波Agent能力的爆发。

然而,在现实环境里, 光有文字记忆,显然还不够 。

因为一旦进入真实的视觉环境,模型不仅需要记住物体的位置、朝向,还要理解每次动作前后,环境究竟发生了哪些变化。

而且 模型第一次看到一张图时,未必知道哪个细节会在后面变得重要。

与此同时,这些视觉信息,也很难提前用一份文字笔记完整记录下来,更难保证模型后续执行任务时,记录的信息依然够用。

在ARC-AGI-3这样的基准中,一种已有思路是先把画面转换成由数字组成的文本网格,再让模型编写程序,模拟环境规则、验证行动方案。

(注释:ARC-AGI-3是一套交互式视觉推理基准,不预先提供游戏规则和目标,智能体需要通过观察和行动,自行摸索如何通关)

但问题在于,环境越复杂,物体的外观、空间关系和动态变化就越难被完整地转化成文字和代码。而且随着交互历史越来越长,早期画面也会被逐渐移出上下文,或者被文字摘要替代。

于是,在这里,VISTA的研究问题就变成了:

如何在不额外训练基础模型的情况下,让智能体在推理需要时,重新检查过去看到的视觉信息?

如何在不额外训练基础模型的情况下,让智能体在推理需要时,重新检查过去看到的视觉信息?

基于此,VISTA把 环境返回的每一帧原样存到上下文之外,包括动作过程中的动画中间帧,模型需要时再取回来。

在ARC-AGI-3评测中,它既能比较不同时刻的画面,也能放大局部,检查小方块上的朝向标记。

其中,文字笔记记录模型当前的理解,原始画面保留供它重新判断的证据。

研究将这种机制称为对交互历史的显式注意力,模型根据正在思考的问题,选择哪些视觉信息重新进入上下文。

要想让这种选择成为可能,系统就得保存原始画面,并提供随时调取和检查的工具。

为了让模型能够保存并利用过去的视觉经验,VISTA设计了三个核心组件:

视觉观测、无损视觉记忆和主动视觉检查。这三个组件各有分工,分别负责让模型看清画面、保存历史,以及按需回看。

首先是视觉观测,负责将环境画面提供给模型。

在ARC-AGI-3实验中,VISTA会将官方提供的64×64画面放大为512×512的PNG图像,同时保留物体的颜色、外观和空间关系,让模型能够直接观察环境。

其次是无损视觉记忆,负责保存模型看到的画面。

每次执行动作后,VISTA都会完整保存环境返回的所有画面,包括动作过程中的动画中间帧,并按照回合号和帧号建立索引。

这样一来,模型就不必提前判断哪些信息值得记住,而是可以先把视觉经验完整保存下来,留待后续使用。

最后是主动视觉检查,负责让模型按需回看历史画面。

通过inspect工具,模型可以指定某个历史回合,调出对应画面,也可以裁剪、放大局部区域,检查其中的细节。

如果想知道某次操作究竟改变了什么,模型还可以一次调出多帧画面,对比动作前后的变化。

整个过程相当于给模型配了一套可以随时翻阅的视觉档案。 它不仅能看到眼前的环境,还能主动回看过去的观察结果,为接下来的行动提供依据。

说到这,这三个组件具体是如何配合工作的?

按照VISTA的执行流程,每个回合开始时,模型会先观察当前画面和可用动作,再结合此前积累的经验,判断当前环境的状态,并提出下一步行动的假设。

如果现有信息不足,模型就可以调用工具,回看历史画面、放大局部区域,甚至读取具体的像素信息,进一步寻找证据。

找到证据之后,模型并不会直接行动,而是先预测这次操作可能带来什么变化。

等动作执行完毕,再将实际结果与预测进行对比,检查自己的判断是否正确,并据此修正对游戏规则的理解。

如此反复,模型就能在持续交互中,一边探索环境,一边积累经验。

当然,光有视觉档案还不够。为了让模型在长时间任务中保持连贯,VISTA还引入了两份文字笔记:

GUIDE.md:记录不同关卡之间可以复用的规则和经验。

WORKING.md:记录当前关卡的状态、进度和后续计划。

当上下文接近上限时,模型会先整理交接摘要,再进入新的上下文窗口继续执行任务。此前的文字笔记、动作历史和视觉档案都会保留下来。

这里还有一个值得注意的设计:VISTA虽然完整保存了历史画面,却不会把所有图片一股脑塞进模型的上下文。

在完整方案中,每次执行动作后,框架默认只向模型展示最后一帧。至于动作过程中的中间画面,则统一保存在视觉档案里,等模型需要时再主动调取。

这样既保留了完整的视觉信息,也避免大量历史图片持续占用上下文空间。

更重要的是,VISTA并没有为此额外训练一个新模型。

环境理解、行动规划和推理仍然由现成的多模态模型完成,Harness则负责执行工具调用、保存视觉历史,并在模型需要时提供相应的证据。

换句话说,VISTA改变的不是模型本身,而是模型获取、保存和使用视觉信息的方式。

除了开头提到的实验以外,团队还在GameWorld、AI GameStore和BabyVision三个基准上测试了VISTA,覆盖浏览器游戏、迷宫和连线等任务。

使用相同的GPT-5.6 Sol模型,相比官方基础框架,VISTA在GameWorld的170项任务中,将成功率从40.0%提高到63.3%;

在AI GameStore的10个游戏中,综合得分从47.3升至140.3,其中人类中位数被归一化为100;

在BabyVision选取的39道迷宫与连线题上,准确率从41.0%提高到63.2%。最后这组任务只有静态图片,模型也能通过放大局部、检查像素,改善判断。

这些结果表明,保存原始画面、让模型按需回看,可以进一步发挥现有多模态模型的能力。

同一套VISTA框架只需少量适配,就能用于不同的游戏与谜题,也展现了它在更多视觉任务中的应用潜力。

在结论上,研究将未来的验证方向指向更接近物理世界的具身任务:让模型在持续变化的环境中,保存、复查并利用自己的视觉经验,决定下一步行动。

最后,让我们介绍这篇工作的作者们。

论文的三位共同第一作者为Qiushi Han、胡珂雅和Linlu Qiu,另外两位作者为Cathy Wu和何恺明。

Qiushi Han(Josh Han) 目前是MIT运筹研究中心博士生,导师为Cathy Wu。

胡珂雅(Keya Hu) 目前是MIT电气工程与计算机科学系博士生,由何恺明和Jacob Andreas联合指导。

她本科毕业于上海交通大学ACM班,研究兴趣集中在语言与视觉的交叉领域,希望构建数据效率更高、泛化能力更强的智能体。

Linlu Qiu 目前是MIT电气工程与计算机科学系及计算机科学与人工智能实验室的博士生,导师为Yoon Kim和Jacob Andreas。

其研究方向包括自然语言处理和机器学习,曾在Google Research及Meta FAIR开展研究。

Cathy Wu 目前是MIT土木与环境工程系、数据系统与社会研究所副教授,研究如何用机器学习和强化学习改进交通等复杂系统。

她在MIT获得学士和工程硕士学位,随后在加州大学伯克利分校获得博士学位。

何恺明 目前是MIT电气工程与计算机科学系终身副教授,也是ResNet、Mask R-CNN和MAE等工作的主要作者。

他本科毕业于清华大学、博士毕业于香港中文大学,曾任职微软亚洲研究院和FAIR,于2024年加入MIT。

参考链接

[1]https://arxiv.org/pdf/2610.02200

Found an error? Send a correction