ATM:面向视频问答的动作时序性建模
计算机视觉与模式识别
2023-09-06 v1
摘要
尽管视频问答(VideoQA)取得了显著进展,现有方法仍不足以应对需要跨帧因果/时序推理的问题。这可归因于不精确的 motion 表示。我们引入动作时序性建模(ATM)以通过三重独特性实现时序推理:(1)反思光流并认识到光流在捕获长跨度时序推理方面有效;(2)以动作中心的方式通过对比学习训练视觉-文本嵌入,从而在视觉与文本模态中获得更好的动作表示;(3)在微调阶段防止模型在给定打乱视频时回答问题,以避免外观与运动间的虚假关联,从而确保忠实的时序推理。在实验中,我们表明 ATM 在多个 VideoQA 上的准确率优于先前方法,并展现出更好的真实时序推理能力。
引用
@article{arxiv.2309.02290,
title = {ATM: Action Temporality Modeling for Video Question Answering},
author = {Junwen Chen and Jie Zhu and Yu Kong},
journal= {arXiv preprint arXiv:2309.02290},
year = {2023}
}