中文

追踪答案:利用时空线索将 TextVQA 从图像扩展到视频

计算机视觉与模式识别 2024-12-18 v1

摘要

视频文本视觉问答 (Video TextVQA) 是一项实用任务,旨在通过对给定视频中的文本和视觉信息进行联合推理来回答问题。受图像领域 TextVQA 发展的启发,现有的 Video TextVQA 方法利用语言模型(如 T5)处理富含文本的多帧并自回归地生成答案。然而,视觉实体(包括场景文本和对象)之间的时空关系会被破坏,且模型容易受到无关信息的干扰,导致不合理的推理和不准确的回答。为了应对这些挑战,我们提出了 TEA(代表“\textbf{T}rack th\textbf{E} \textbf{A}nswer”)方法,将生成式 TextVQA 框架更好地从图像扩展到视频。TEA 以互补的方式恢复时空关系,并结合 OCR 感知线索以增强问题推理的质量。在多个公开 Video TextVQA 数据集上的大量实验验证了我们框架的有效性和泛化能力。TEA 以巨大优势超越了现有的 TextVQA 方法、视频-语言预训练方法和视频大语言模型。

关键词

引用

@article{arxiv.2412.12502,
  title  = {Track the Answer: Extending TextVQA from Image to Video with Spatio-Temporal Clues},
  author = {Yan Zhang and Gangyan Zeng and Huawen Shen and Daiqing Wu and Yu Zhou and Can Ma},
  journal= {arXiv preprint arXiv:2412.12502},
  year   = {2024}
}

备注

Accepted by AAAI 2025