QTG-VQA:面向视频问答系统的问句类型导向架构
计算机视觉与模式识别
2024-09-17 v1
摘要
在视频问答(VideoQA)领域,对问句类型的影响尽管至关重要,但迄今为止鲜有被充分探讨。然而,问句类型的丰富性直接决定了模型需要学习的概念范围,从而影响其学习能力的上限。本文聚焦于探讨不同问句类型对 VideoQA 系统的重要性及其对性能的影响,揭示了一系列问题,如由于问句类型分布不均导致的学习不足和模型退化。特别地,考虑到不同问句类型对时序信息依赖程度差异显著,且这种信息的表征恰好也是 VideoQA 与 ImageQA 相比的主要挑战和难点之一。为此,我们提出了 QTG-VQA,这是一种新型架构,融合了问句类型导向的注意力机制和自适应学习机制。具体而言,针对时序类型问句,我们设计了 Masking Frame Modeling 技术以增强时序建模,旨在鼓励模型把握更丰富的视觉-语言关系,管理更复杂的时序依赖。此外,本文引入了一种量身定制的、针对问句类型的评估指标。实验结果确认了我们方法的有效性。
引用
@article{arxiv.2409.09348,
title = {QTG-VQA: Question-Type-Guided Architectural for VideoQA Systems},
author = {Zhixian He and Pengcheng Zhao and Fuwei Zhang and Shujin Lin},
journal= {arXiv preprint arXiv:2409.09348},
year = {2024}
}