中文

Col-OLHTR:一种新颖的多模态在线手写文本识别框架

计算机视觉与模式识别 2025-02-11 v1 信号处理

摘要

在线手写文本识别(OLHTR)因其广泛的应用而受到相当多的关注。当前方法通常将OLHTR视为序列识别任务,采用单一轨迹或图像编码器,或多流编码器,并结合CTC或基于注意力的识别解码器。然而,这些方法面临几个缺点:1)单一编码器通常关注局部轨迹或视觉区域,缺乏在挑战性情况下动态捕捉相关全局特征的能力;2)多流编码器虽然更全面,但结构复杂且推理成本增加。为了解决这个问题,我们提出了一种基于协作学习的OLHTR框架,称为Col-OLHTR,它在训练期间学习多模态特征,同时保持单流推理过程。Col-OLHTR由一个轨迹编码器、一个点到空间对齐(P2SA)模块和一个基于注意力的解码器组成。P2SA模块旨在通过轨迹编码特征和二维旋转位置嵌入来学习图像级空间特征。在训练期间,额外训练一个图像流编码器-解码器进行协作训练,为P2SA特征提供监督。在推理时,额外的流被丢弃,仅使用P2SA模块并在解码器之前进行合并,从而简化了过程,同时保持了高性能。在多个OLHTR基准上的大量实验结果证明了其最先进的(SOTA)性能,验证了我们设计的有效性和鲁棒性。

关键词

引用

@article{arxiv.2502.06100,
  title  = {Col-OLHTR: A Novel Framework for Multimodal Online Handwritten Text Recognition},
  author = {Chenyu Liu and Jinshui Hu and Baocai Yin and Jia Pan and Bing Yin and Jun Du and Qingfeng Liu},
  journal= {arXiv preprint arXiv:2502.06100},
  year   = {2025}
}

备注

ICASSP 2025