从指令中预测视觉动态:统一视觉语言模型中的动作锚定动态引导
计算机视觉与模式识别
2026-02-13 v2 人工智能
计算与语言
摘要
统一视觉语言模型(VLM)能否进行前向动态预测(FDP),即根据前一帧观察和语言形式的动作预测未来状态(以图像形式)?我们发现,VLM在从指令生成帧之间物理上合理的转换方面存在困难。然而,我们识别出一种多模态对齐中的关键不对称性:针对逆向动态预测(IDP)进行微调,即为帧之间的动作生成描述,比学习FDP要容易得多。相反,IDP可用于通过两种主要策略引导FDP:1)来自合成数据的弱监督学习,以及2)推理时间验证。首先,IDP可以为无标签的视频帧观察对添加动作,从而扩大FDP训练数据的规模。其次,IDP可以为FDP的多个样本分配奖励,以对其进行评分,有效指导推理时的搜索。我们通过在Aurora-Bench上进行动作中心图像编辑任务,评估了两种策略所产生的FDP,采用两种VLM家族。尽管保持通用性,最佳模型在GPT4o评判下实现了与最先进图像编辑模型相当的性能,提升幅度为7%至13%,并在Aurora-Bench的所有子集中实现了最佳平均人类评估。
引用
@article{arxiv.2506.06006,
title = {Bootstrapping Action-Grounded Visual Dynamics in Unified Vision-Language Models},
author = {Yifu Qiu and Yftah Ziser and Anna Korhonen and Shay B. Cohen and Edoardo M. Ponti},
journal= {arXiv preprint arXiv:2506.06006},
year = {2026}
}