中文

用于视频问答的多目标事件图表征学习

计算机视觉与模式识别 2024-09-13 v1 人工智能 计算与语言

摘要

视频问答 (VideoQA) 是一项针对给定视频提出的问题预测正确答案的任务。系统必须理解从视频中提取的对象之间的空间和时间关系,以执行因果和时间推理。虽然先前的工作集中于使用基于 Transformer 的方法建模单个对象的运动,但它们在捕捉涉及多个对象的复杂场景时表现不佳(例如,“一个男孩正把球投进篮筐”)。我们提出了一种名为 CLanG 的对比语言事件图表征学习方法来解决这一局限性。旨在捕捉与多个对象相关的事件表征,我们的方法采用多层 GNN-cluster 模块进行对抗图表征学习,从而实现问题文本与其相关多目标事件图之间的对比学习。我们的方法优于强基线,在两个具有挑战性的 VideoQA 数据集 NExT-QA 和 TGIF-QA-R 上实现了高达 2.2% 的准确率提升。特别是,在处理因果和时间问题方面,它比基线高出 2.8%,突显了其在推理多个基于对象的事件方面的优势。

关键词

引用

@article{arxiv.2409.07747,
  title  = {Multi-object event graph representation learning for Video Question Answering},
  author = {Yanan Wang and Shuichiro Haruta and Donghuo Zeng and Julio Vizcarra and Mori Kurokawa},
  journal= {arXiv preprint arXiv:2409.07747},
  year   = {2024}
}

备注

presented at MIRU2024