中文

MSTAR:基于注意力循环的盒式无关多查询场景文本检索

计算机视觉与模式识别 2025-12-23 v2

摘要

场景文本检索已在精准文本定位的帮助下取得显著进展。然而,现有方法通常需要昂贵的边界框标注才能进行训练,而且大多数采用自定义检索策略,难以统一处理各种查询类型以满足多样化检索需求。为此,本文引入了一种基于注意力循环的多查询场景文本检索方法(MSTAR),这是一种无需边界框标注的检索方案。它融合了渐进式视觉嵌入以动态捕获文本的多层次表征,同时将自由形式的文本查询与风格感知指令相结合。此外,本文构建了多查询文本检索(MQTR)数据集,首个专用于评估模型多查询场景文本检索能力的基准数据集,包含四种查询类型和 16k 张图像。广泛实验表明,我们的方法在七个公开数据集和 MQTR 数据集上均表现优异。值得注意的是,MSTAR 在 Total-Text 数据集上的 MAP 略胜前一模型 6.4%,且无需边界框标注。此外,在 MQTR 框架下,MSTAR 相较于以往模型平均提升 8.5%。代码和数据集已提供于 https://github.com/yingift/MSTAR。

关键词

引用

@article{arxiv.2506.10609,
  title  = {MSTAR: Box-free Multi-query Scene Text Retrieval with Attention Recycling},
  author = {Liang Yin and Xudong Xie and Zhang Li and Xiang Bai and Yuliang Liu},
  journal= {arXiv preprint arXiv:2506.10609},
  year   = {2025}
}

备注

Neurips 2025