MDiff4STR:用于场景文本识别的掩码扩散模型
计算机视觉与模式识别
2025-12-02 v1
摘要
掩码扩散模型(MDMs)最近作为视觉语言任务中对自回归模型(ARMs)的有前景的替代方案,因其灵活的效率与准确性平衡而受到关注。本文首次将 MDMs 引入场景文本识别(STR)任务。我们表明,vanilla MDM 在准确率上落后于 ARMs,尽管提升了识别效率。为弥合这一差距,我们提出 MDiff4STR,一个针对 STR 增强的掩码扩散模型,包含两个关键改进策略。具体而言,我们确定将 MDMs 应用于 STR 的两个关键挑战:训练与推理之间的 noising gap,以及推理期间的过度自信预测。这两个因素显著阻碍了 MDMs 的性能。为缓解第一个问题,我们开发了六种 noising 策略,以更好地对齐训练与推理行为。对于第二个问题,我们提出了一种 token 替换噪声机制,提供一种非掩码噪声类型,鼓励模型重新考虑和修订过于自信但不正确的预测。我们在标准和具有挑战性的 STR 基准上进行了广泛评估,涵盖各种场景,包括不规则、艺术、遮挡和中文文本,以及是否使用预训练。 在这些设置下,MDiff4STR 在准确率上 consistently 超过流行的 STR 模型,甚至在准确率上超过最先进的 ARMs,同时仅需三个去噪步骤即可保持快速推理。代码:https://github.com/Topdu/OpenOCR。
引用
@article{arxiv.2512.01422,
title = {MDiff4STR: Mask Diffusion Model for Scene Text Recognition},
author = {Yongkun Du and Miaomiao Zhao and Songlin Fan and Zhineng Chen and Caiyan Jia and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2512.01422},
year = {2025}
}
备注
Accepted by AAAI 2026 (Oral)