基于多模态上下文学习的少样本书写者适配
计算机视觉与模式识别
2026-04-01 v1 人工智能
摘要
尽管最先进的手写文本识别(HTR)模型在标准基准测试上表现良好,但它们在训练数据中代表性不足的具有高度特定风格的书写者身上经常遇到困难。为了处理未见和非典型的书写者,书写者适配技术将HTR模型个性化到特定的书写风格。领先的书写者适配方法需要离线微调或推理时的参数更新,两者都涉及梯度计算和反向传播,增加了计算成本并需要仔细的超参数调优。在这项工作中,我们提出了一种受多模态上下文学习启发的新型上下文驱动HTR框架,仅使用目标书写者的少量示例即可实现推理时的书写者适配,无需任何参数更新。我们进一步研究了上下文长度的影响,设计了一个紧凑的8M参数CNN-Transformer以实现少样本上下文适配,并证明将上下文驱动方法与标准OCR训练策略相结合带来了互补的改进。在IAM和RIMES上的实验验证了我们的方法,字符错误率分别为3.92%和2.34%,超越了所有无需推理时参数更新的书写者无关HTR模型。
引用
@article{arxiv.2603.29450,
title = {Few-shot Writer Adaptation via Multimodal In-Context Learning},
author = {Tom Simon and Stephane Nicolas and Pierrick Tranouez and Clement Chatelain and Thierry Paquet},
journal= {arXiv preprint arXiv:2603.29450},
year = {2026}
}