通过辅助任务与多 token 预测提升视觉规划
计算机视觉与模式识别
2025-07-22 v1
摘要
视觉规划辅助 (Visual Planning for Assistance, VPA) 旨在基于显示用户进展的视频,预测实现指定目标所需的用户动作序列。尽管最近在多模态大语言模型 (MLLM) 在视频理解方面的进展显示出前景,但长程视觉规划仍是一个具有挑战性的问题。我们确定了大规模 MLLM 在视频基于规划任务中存在两个挑战:(1) 程序性注释稀缺,限制了模型有效学习程序任务动态的能力;(2) 与自由形式、自然语言相比,下一 token 预测目标不够高效,难以显式捕获视觉规划特有的结构化动作空间。为克服数据稀缺问题,我们引入辅助任务增强 (Auxiliary Task Augmentation)。我们设计并在与长程视频基于规划相关的辅助任务上训练模型(例如目标预测),以增强模型的规划能力。为更显式地建模视觉规划任务特有的结构化动作空间,我们利用多 token 预测 (Multi-token Prediction),将传统的下一 token 预测扩展为在训练期间使用多个头预测多个未来 token。我们的方法 VideoPlan 在 COIN 和 CrossTask 数据集上实现了 VPA 的最新性能,分别在预测 3 个未来动作时超越了先前方法 7.3% 和 3.4%。我们进一步将该方法扩展到具有挑战性的 Ego4D 长期动作预测任务,显示其在不使用专用 egocentric 特征的情况下与最新方法持平。代码将公开发布。
引用
@article{arxiv.2507.15130,
title = {Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction},
author = {Ce Zhang and Yale Song and Ruta Desai and Michael Louis Iuzzolino and Joseph Tighe and Gedas Bertasius and Satwik Kottur},
journal= {arXiv preprint arXiv:2507.15130},
year = {2025}
}