SFA:面向引导感知的视频文本VQA的扫描、聚焦与放大
计算机视觉与模式识别
2025-11-26 v1
摘要
基于视频的文本视觉问答(Video TextVQA)任务旨在通过利用视频中出现的视觉文本回答关于视频的问题。该任务提出了重大挑战,要求模型准确感知和理解在帧之间尺度、方向和清晰度各异的场景文本,同时有效整合时间和语义上下文以生成精确答案。此外,模型必须识别与问题相关的文本线索,并过滤掉冗余或无关信息,以确保回答由最相关和最具信息量的线索引导。为应对这些挑战,我们提出了SFA,一个无需训练的框架,也是首个专为Video TextVQA设计的基于视频大语言模型(Video-LLM)的方法,其灵感来源于人类回答问题的过程。通过自适应地扫描视频帧、选择性地聚焦于关键区域并直接放大它们,SFA有效地引导Video-LLM的注意力朝向关键线索,使其能够生成更准确的答案。SFA在多个公开Video TextVQA数据集上取得了新的最先进结果,并以显著优势超越了先前方法,证明了其有效性和泛化能力。
引用
@article{arxiv.2511.20190,
title = {SFA: Scan, Focus, and Amplify toward Guidance-aware Answering for Video TextVQA},
author = {Haibin He and Qihuang Zhong and Juhua Liu and Bo Du and Peng Wang and Jing Zhang},
journal= {arXiv preprint arXiv:2511.20190},
year = {2025}
}