Q-Mask:面向OCR视觉语言模型的查询驱动因果掩码用于文本定位
计算机视觉与模式识别
2026-04-22 v2
摘要
光学字符识别(OCR)正日益被视为现代视觉语言模型(VLM)的基础能力,使其不仅能够读取图像中的文本,还能支持下游真实世界视觉问答(VQA)中的推理。然而,实际应用进一步要求可靠的文本锚点,即准确地将查询文本定位到其对应的空间区域。为系统评估这一能力,我们引入了 TextAnchor-Bench(TABench),一个细粒度文本区域定位基准,揭示通用 VLM 和 OCR 专用 VLM 在建立准确稳定的文本锚点方面仍然存在困难。为解决这一局限,我们提出了 Q-Mask,一个基于因果查询驱动掩码解码器(CQMD)的精确 OCR 框架。借鉴思维链推理,Q-Mask 执行因果视觉解码,在生成最终 OCR 输出之前依次生成查询条件视觉掩码。这种视觉 CoT 范式将文本的位置与文本的内容解耦,强制在识别之前获取有据证据,并在推理期间实现显式的文本锚点构建。为训练 CQMD,我们构建了 TextAnchor-26M,一个大规模图像-文本对数据集,带有与特定文本元素对应的细粒度掩码标注,鼓励稳定的文本区域对应并将强空间先验注入 VLM 训练。大量实验表明 Q-Mask 在多样化视觉场景中显著提升了文本定位与理解能力。
引用
@article{arxiv.2604.00161,
title = {Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models},
author = {Longwei Xu and Feng Feng and Shaojie Zhang and Xin Chen and Hang Li and Anan Du and Hailong Yu and Pei Fu and Zhenbo Luo and Jian Luan},
journal= {arXiv preprint arXiv:2604.00161},
year = {2026}
}