中文

admitting Ignorance 有助于视频问答模型作答

计算机视觉与模式识别 2025-07-03 v2

摘要

感谢深度学习和大规模预训练,视频问答(VideoQA)领域取得了显著进展。尽管存在复杂的模型结构和强大的视频文本基础模型,但大多数现有方法仅致力于最大化答案与视频-问题对之间的相关性。在训练期间。我们认为,这些模型通常会建立捷径,导致问题和答案之间出现虚假相关性,尤其是在视频和文本数据之间的对齐度不佳时。为解决这些虚假相关性,我们提出了一种新颖的训练框架,要求模型在面对干扰问题时承认其无知,而不是仅仅基于浅显的问答相关性进行猜测。我们介绍了用于干扰问题的方法,包括位移和扰动技术,并设计了模型在多选 VideoQA 和开放式设置下承认其知识缺失的框架。实际中,我们将一种最先进的模型整合到我们的框架中来验证其有效性。结果清晰地表明,我们的框架可显著提升 VideoQA 模型的性能,所需的结构修改最小。

关键词

引用

@article{arxiv.2501.08771,
  title  = {Admitting Ignorance Helps the Video Question Answering Models to Answer},
  author = {Haopeng Li and Tom Drummond and Mingming Gong and Mohammed Bennamoun and Qiuhong Ke},
  journal= {arXiv preprint arXiv:2501.08771},
  year   = {2025}
}