通用 Khmer 文本识别
计算机视觉与模式识别
2026-03-03 v1
摘要
Khmer 是一种语言资源稀缺且脚本复杂的语言,为光学字符识别 (OCR) 带来了显著挑战。尽管文档打印文本识别因数据集的可用性而取得了进展,但针对其他模态(如手写和场景文本)的性能仍受数据稀缺的限制。为每个模态训练特定模型无法实现跨模态迁移学习,而这正是稀缺模态可从中受益的机会。此外,部署众多模态特定模型会导致显著的内存开销,并需要将每个输入图像错误地路由到合适的模型。另一方面,仅用非均匀数据分布的组合数据集进行训练常导致对 underrepresented 模态性能下降。在此基础上,我们提出一种通用 Khmer 文本识别 (Universal Khmer Text Recognition, UKTR) 框架,能够处理多样化的文本模态。我们方法的核心是一种新颖的模态感知自适应特征选择 (Modality-Aware Adaptive Feature Selection, MAFS) 技术,旨在根据特定输入图像的模态调整视觉特征,以增强跨模态的识别鲁棒性。大量实验表明,我们的模型实现了最先进 (SOTA) 的性能。此外,我们引入了第一个全面基准,用于通用 Khmer 文本识别,我们将其发布给社区以促进未来研究。我们的数据集和模型可通过此 gated 存储库获取\footnote{in review}。
引用
@article{arxiv.2603.00702,
title = {Towards Universal Khmer Text Recognition},
author = {Marry Kong and Rina Buoy and Sovisal Chenda and Nguonly Taing and Masakazu Iwamura and Koichi Kise},
journal= {arXiv preprint arXiv:2603.00702},
year = {2026}
}
备注
17 pages, 9 figures, 6 tables