中文

用于基于文本的视频问答的场景文本定位

计算机视觉与模式识别 2025-05-20 v3 多媒体

摘要

现有的基于文本的视频问答(TextVideoQA)工作因其决策过程不透明且严重依赖场景文本识别而受到批评。在本文中,我们提出研究 Grounded TextVideoQA,通过强制模型回答问题并在时空上定位相关的场景文本区域,从而将 QA 与场景文本识别解耦,并推动向可解释 QA 的研究。该任务具有三重意义。首先,它鼓励使用场景文本证据而非其他捷径进行答案预测。其次,它直接接受场景文本区域作为视觉答案,从而规避了因严格字符串匹配导致答案评估无效的问题。第三,它隔离了 VideoQA 和场景文本识别中固有的挑战。这使得能够诊断预测失败的根本原因,例如是 QA 错误还是场景文本识别错误?为实现 Grounded TextVideoQA,我们提出了 T2S-QA 模型,该模型突出了一种解耦的时序到空间对比学习策略,用于弱监督场景文本定位和 Grounded TextVideoQA。为便于评估,我们构建了一个新数据集 ViTXT-GQA,其包含与 2K 个问题和 729 个视频相关的 2.2K 个时间片段内的 52K 个场景文本边界框。借助 ViTXT-GQA,我们进行了广泛实验,并证明了现有技术在 Grounded TextVideoQA 中的严重局限性。尽管 T2S-QA 取得了优越的结果,但与人类相比的巨大性能差距留下了充足的改进空间。我们对 oracle 场景文本输入的进一步分析表明,主要挑战在于场景文本识别。为推进 Grounded TextVideoQA 的研究,我们的数据集和代码位于 https://github.com/zhousheng97/ViTXT-GQA.git

关键词

引用

@article{arxiv.2409.14319,
  title  = {Scene-Text Grounding for Text-Based Video Question Answering},
  author = {Sheng Zhou and Junbin Xiao and Xun Yang and Peipei Song and Dan Guo and Angela Yao and Meng Wang and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2409.14319},
  year   = {2025}
}

备注

Accepted by IEEE TMM