中文

超越可见线索:基于双线索推理的隐式视频问答

计算机视觉与模式识别 2025-12-12 v2

摘要

视频问答旨在基于给定视频回答自然语言问题,先前的工作主要关注识别相关时段的持续时间,称为显式视觉证据。然而,显式视觉证据并不总是直接可用,尤其是当问题针对符号意义或更深层意图时,会导致显著性能下降。为填补这一空白,我们引入一种新型任务和数据集,隐式视频问答(I-VQA),其聚焦于在显式视觉证据不可获得的场景下回答问题。给定隐式问题及其对应的视频,I-VQA要求基于视频中存在的情境视觉线索进行回答。为解决I-VQA,我们提出一种新型推理框架,IRM(Implicit Reasoning Model),其包含对情境动作和意图线索的双流建模,作为隐式推理链。IRM由动作-意图模块(AIM)和视觉增强模块(VEM)组成。AIM通过生成线索候选项并执行关系推断来推导并保留与问题相关的双线索。VEM通过利用关键情境线索来增强情境视觉表征。大量实验验证了IRM在I-VQA任务中的有效性,相较于GPT-4o、OpenAI-o3和微调的VideoChat2分别提升了0.76%、1.37%和4.87%。此外,IRM在类似的隐式广告理解和交通视频问答中的未来预测任务中实现了SOTA。数据集和代码已在匿名仓库中提供供双盲评审:https://github.com/tychen-SJTU/Implicit-VideoQA。

关键词

引用

@article{arxiv.2506.07811,
  title  = {Looking Beyond Visible Cues: Implicit Video Question Answering via Dual-Clue Reasoning},
  author = {Tieyuan Chen and Huabin Liu and Yi Wang and Chaofan Gan and Mingxi Lyu and Ziran Qin and Shijie Li and Liquan Shen and Junhui Hou and Zheng Wang and Weiyao Lin},
  journal= {arXiv preprint arXiv:2506.07811},
  year   = {2025}
}

备注

Preprint