中文

基于实例导向视角重新思考视频文本VQA

计算机视觉与模式识别 2025-08-07 v1 人工智能

摘要

视频文本视觉问答(Video TextVQA)旨在通过显式读取和推理视频中涉及的文本来回答问题。该领域的大多数工作遵循帧级框架, suffer from冗余文本实体和隐式关系建模,导致在准确性和效率方面存在局限。本文从实例导向视角重新思考Video TextVQA任务,提出一种新模型,称为GAT(Gather and Trace)。首先,为获得每个视频文本实例的准确阅读结果,设计了一个上下文聚合实例收集模块,用于整合与相关实体相关的视觉外观、布局特征和文本内容,形成统一的文本表示。然后,为捕捉文本在视频流中的动态演化,利用实例聚焦的轨迹追踪模块,用于建立实例之间的时空关系,并推断最终答案。在几个公开Video TextVQA数据集上的大量实验验证了该框架的有效性和通用性。GAT在准确性和推理速度方面均优于现有的Video TextVQA方法、视频语言预训练方法和视频大语言模型。值得注意的是,GAT在准确性上比前任最佳Video TextVQA方法提升了3.86%,推理速度比视频大语言模型快十倍。源代码可在https://github.com/zhangyan-ucas/GAT上获取。

关键词

引用

@article{arxiv.2508.04197,
  title  = {Gather and Trace: Rethinking Video TextVQA from an Instance-oriented Perspective},
  author = {Yan Zhang and Gangyan Zeng and Daiqing Wu and Huawen Shen and Binbin Li and Yu Zhou and Can Ma and Xiaojun Bi},
  journal= {arXiv preprint arXiv:2508.04197},
  year   = {2025}
}

备注

Accepted by 2025 ACM MM