从特征与样本视角重思视频问答中的多模态对齐
计算机视觉与模式识别
2022-11-03 v2 人工智能
摘要
对视频中因果与时序事件关系进行推理是视频问答(VideoQA)的新目标。实现该目的的主要障碍在于语言与视频因抽象层次不同而产生的语义鸿沟。现有努力主要聚焦于设计复杂架构,同时利用帧级或对象级视觉表征。本文中,我们从特征与样本视角重新考量VideoQA中的多模态对齐问题,以取得更优性能。从特征视角,我们将视频分解为轨迹,并首次在VideoQA中利用轨迹特征来增强两模态间的对齐。此外,我们采用异质图架构并设计分层框架,以将轨迹级与帧级视觉特征同语言特征对齐。另外,我们发现VideoQA模型高度依赖语言先验并总是忽略视觉-语言交互。因此,从样本视角设计了两种有效且可移植的训练增强策略,以加强模型的跨模态对应能力。大量结果表明,我们的方法在具有挑战性的NExT-QA基准上优于所有SOTA模型,证明了所提方法的有效性。
引用
@article{arxiv.2204.11544,
title = {Rethinking Multi-Modal Alignment in Video Question Answering from Feature and Sample Perspectives},
author = {Shaoning Xiao and Long Chen and Kaifeng Gao and Zhao Wang and Yi Yang and Zhimeng Zhang and Jun Xiao},
journal= {arXiv preprint arXiv:2204.11544},
year = {2022}
}