中文

长自我中心视频中的时序定位问答

计算机视觉与模式识别 2024-04-02 v4

摘要

现有的视频理解方法主要针对第三人称视角的短视频设计,其在某些领域(如机器人学)的适用性有限。在本文中,我们深入研究长自我中心视频中的开放式问答(QA),这使个人或机器人能够查询其自身的过去视觉经验。该任务带来独特挑战,包括在海量视频内容中时序定位查询的复杂性、精确数据标注的高资源需求,以及由于开放式答案的模糊性导致的评估固有困难。我们提出的方法通过以下方式应对这些挑战:(i) 在统一模型中集成查询定位与回答以减少误差传播;(ii) 采用大语言模型进行高效且可扩展的数据合成;(iii) 引入封闭式 QA 任务用于评估,以管理答案模糊性。大量实验证明了我们方法的有效性,该方法还在 QaEgo4D 和 Ego4D-NLQ 基准上取得了最先进性能。代码、数据和模型可在 https://github.com/Becomebright/GroundVQA 获取。

关键词

引用

@article{arxiv.2312.06505,
  title  = {Grounded Question-Answering in Long Egocentric Videos},
  author = {Shangzhe Di and Weidi Xie},
  journal= {arXiv preprint arXiv:2312.06505},
  year   = {2024}
}

备注

Accepted to CVPR 2024. Project website at https://dszdsz.cn/GroundVQA