TOGA:弱监督下的时间定位开放式视频问答
计算机视觉与模式识别
2025-06-12 v1 人工智能
摘要
我们研究了弱监督设置下的视频问答(video QA)时间定位问题,无需任何时间标注。给定一个视频和一个问题,我们生成一个由起始和结束时间定位的开放式答案。为此,我们提出了 TOGA:一种用于弱监督下时间定位开放式视频问答的视觉语言模型。我们对 TOGA 进行指令微调,使其联合生成答案和时间定位。我们在时间定位标注不可用的弱监督设置下运行。我们为时间定位生成伪标签,并通过确保定位响应的问题与引用同一时间段的响应生成的问题之间的一致性约束来验证这些标签的有效性。我们注意到联合生成答案和定位可同时提升问答和定位的性能。我们在定位 QA 和开放式 QA 任务上评估 TOGA。对于定位 QA,我们考虑 NExT-GQA 基准,该基准旨在评估弱监督定位问答。对于开放式 QA,我们考虑 MSVD-QA 和 ActivityNet-QA 基准。我们在这两个基准上均取得了最先进的性能。
引用
@article{arxiv.2506.09445,
title = {TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision},
author = {Ayush Gupta and Anirban Roy and Rama Chellappa and Nathaniel D. Bastian and Alvaro Velasquez and Susmit Jha},
journal= {arXiv preprint arXiv:2506.09445},
year = {2025}
}