长自我中心视频中的时序定位问答
计算机视觉与模式识别
2024-04-02 v4
摘要
现有的视频理解方法主要针对第三人称视角的短视频设计,其在某些领域(如机器人学)的适用性有限。在本文中,我们深入研究长自我中心视频中的开放式问答(QA),这使个人或机器人能够查询其自身的过去视觉经验。该任务带来独特挑战,包括在海量视频内容中时序定位查询的复杂性、精确数据标注的高资源需求,以及由于开放式答案的模糊性导致的评估固有困难。我们提出的方法通过以下方式应对这些挑战:(i) 在统一模型中集成查询定位与回答以减少误差传播;(ii) 采用大语言模型进行高效且可扩展的数据合成;(iii) 引入封闭式 QA 任务用于评估,以管理答案模糊性。大量实验证明了我们方法的有效性,该方法还在 QaEgo4D 和 Ego4D-NLQ 基准上取得了最先进性能。代码、数据和模型可在 https://github.com/Becomebright/GroundVQA 获取。
引用
@article{arxiv.2312.06505,
title = {Grounded Question-Answering in Long Egocentric Videos},
author = {Shangzhe Di and Weidi Xie},
journal= {arXiv preprint arXiv:2312.06505},
year = {2024}
}
备注
Accepted to CVPR 2024. Project website at https://dszdsz.cn/GroundVQA