中文文本的人工智能多模态字符定位与提取
计算机视觉与模式识别
2026-03-17 v1 人工智能
摘要
场景文本识别(STR)方法在英文文本图像中展现出卓越的能力。然而,由于中文字符内部结构复杂且类别繁多,这给识别图像中的中文文本提出了挑战。最近的研究表明,针对英文文本设计的方法在识别中文文本图像时会遇到准确率瓶颈。这引发了一个问题:为何不能将为英文开发的模型直接应用于中文STR任务中?为了探索这一问题,我们提出了一种新方法,称为LER,通过显式解耦每个字符并独立识别字符,同时考虑中文复杂的内部结构。LER由三个模块组成:定位、提取和识别。首先,定位模块利用多模态信息精确定位字符位置。随后,提取模块并行解耦所有字符。最后,识别模块考虑中文独特的内部结构,提供文本预测结果。在大规模中文基准数据集上的广泛实验表明,我们的方法显著优于现有方法。此外,在六个英文基准数据集和Union14M数据集上的大量实验显示,LER在英文文本识别方面也表现出色。代码可在https://github.com/Pandarenlql/LER获取。
引用
@article{arxiv.2603.13886,
title = {Multi-Modal Character Localization and Extraction for Chinese Text Recognition},
author = {Qilong Li and Chongsheng Zhang},
journal= {arXiv preprint arXiv:2603.13886},
year = {2026}
}
备注
On January 08th, 2026, this paper has been accepted by the IEEE Transactions on Multimedia journal. To appear