基于 IMU 的在线手写体识别中的标记化与数据增强:对撰写者差异的系统性研究
计算机视觉与模式识别
2026-03-19 v1 计算与语言
机器学习
信号处理
摘要
惯性测量单元(IMU)基于在线手写体识别,使能够识别跨不同书写表面的输入信号,但面临字符分布不均与撰写者差异的问题。本文系统性地研究了两大策略来应对这些问题:子词标记化与拼接式数据增强。我们对 OnHW-Words500 数据集进行实验,发现处理撰写者差异与内部撰写者差异存在明显的二分态:在撰写者无关的划分上,通过 Bigram 标记化实现结构抽象化,显著提升对未见撰写风格的性能,将词错误率(WER)从 15.40% 降至 12.99%。相反,在撰写者依赖的划分上,标记化会因训练集与验证集之间的词汇分布偏移而导致性能下降。相比之下,我们提出的拼接式数据增强作为强大的正则化手段,将字符错误率降低 34.5%,WER 降低 25.4%。进一步分析表明,短小且低层次的标记对模型性能有益,拼接式数据增强的性能提升优于按比例延长训练所实现的提升。这一发现揭示了清晰的差异依赖效应:子词标记化主要缓解撰写者风格的差异,而拼接式数据增强则有效补偿内部撰写者分布稀疏性。
引用
@article{arxiv.2603.16883,
title = {Tokenization vs. Augmentation: A Systematic Study of Writer Variance in IMU-Based Online Handwriting Recognition},
author = {Jindong Li and Dario Zanca and Vincent Christlein and Tim Hamann and Jens Barth and Peter Kämpf and Björn Eskofier},
journal= {arXiv preprint arXiv:2603.16883},
year = {2026}
}