中文

HAAP:用于场景文本识别的视觉上下文分层注意力自回归与自适应置换

计算机视觉与模式识别 2026-02-04 v2 人工智能

摘要

当文本不可读时,场景文本识别(STR)在从视觉数据中提取有效字符表示方面面临挑战。置换语言建模(PLM)被引入以通过联合捕获上下文和视觉信息来优化字符预测。然而,在 PLM 中,随机置换的使用会导致训练拟合振荡,且迭代细化(IR)操作也引入了额外开销。为了解决这些问题,本文提出了具有自适应置换的分层注意力自回归模型(HAAP),以增强位置-上下文-图像交互能力,从而提高自回归 LM 的泛化能力。首先,我们提出了隐式置换神经元(IPN)来生成自适应注意力掩码,动态利用 token 依赖关系,增强视觉信息与上下文之间的相关性。自适应相关性表示有助于模型避免训练拟合振荡。其次,引入了跨模态分层注意力机制(CHA)来捕获位置查询、上下文语义和视觉信息之间的依赖关系。CHA 使位置 token 能够聚合全局语义信息,从而避免了对 IR 的需求。大量实验结果表明,所提出的 HAAP 在多个数据集上的准确率、复杂度和延迟方面均达到了 SOTA 性能。

关键词

引用

@article{arxiv.2405.09125,
  title  = {HAAP: Vision-context Hierarchical Attention Autoregressive with Adaptive Permutation for Scene Text Recognition},
  author = {Honghui Chen and Yuhang Qiu and Jiabao Wang and Pingping Chen and Nam Ling},
  journal= {arXiv preprint arXiv:2405.09125},
  year   = {2026}
}

备注

12 pages, 12 figures