中文

VIGiA:通过对话推理与检索实现教学视频指导

计算机视觉与模式识别 2026-04-01 v2 计算与语言

摘要

我们提出了VIGiA,一种新颖的多模态对话模型,旨在理解和推理复杂的、多步骤的教学视频行动计划。与以往主要关注纯文本指导或将视觉与语言孤立处理的工作不同,VIGiA支持基于计划的、有依据的对话,这需要对视觉输入、教学计划以及交错的用户交互进行推理。为此,VIGiA具备两项关键能力:(1)多模态计划推理,使模型能够将单模态和多模态查询与当前任务计划对齐并准确响应;(2)基于计划的检索,使其能够以文本或视觉表示形式检索相关的计划步骤。我们在一个包含丰富的教学视频对话并与烹饪和DIY计划对齐的新数据集上进行了实验。我们的评估表明,在对话式计划指导场景中,VIGiA在所有任务上均优于现有最先进模型,在计划感知的VQA上达到了超过90%的准确率。

关键词

引用

@article{arxiv.2602.19146,
  title  = {VIGiA: Instructional Video Guidance via Dialogue Reasoning and Retrieval},
  author = {Diogo Glória-Silva and David Semedo and João Maglhães},
  journal= {arXiv preprint arXiv:2602.19146},
  year   = {2026}
}

备注

Published at EACL 2026 Findings