中文

基于因果理解的视频问答

人工智能 2024-07-31 v1

摘要

视频问答是一项具有挑战性的任务,需要模型在多个帧上进行推理,并理解不同物体之间的相互作用,以基于视频中提供的上下文来回答问题。这在以 NExT-QA 数据集为例(Xiao 等,2021a),该数据集强调因果和时间问题时尤为重要。以往方法要么利用子样本信息,要么结合完整视频特征和因果干预技术来应对 NExT-QA 任务。本文揭示了这些方法的局限性,并提出四个新颖的改进方向以提升 NExT-QA 数据集上的表现。我们的做法通过智能抽取帧、显式编码动作并创建挑战模型理解的干预,系统性地针对性地解决了前述问题。总体而言,对于基于单帧(提升 6.3%)和完整视频(提升 1.1%)的方法,我们在 NExT-QA 数据集上取得了最新的性能。

关键词

引用

@article{arxiv.2407.20257,
  title  = {Causal Understanding For Video Question Answering},
  author = {Bhanu Prakash Reddy Guda and Tanmay Kulkarni and Adithya Sampath and Swarnashree Mysore Sathyendra},
  journal= {arXiv preprint arXiv:2407.20257},
  year   = {2024}
}