ScribeTokens:固定词表的数字笔迹分词
计算机视觉与模式识别
2026-03-04 v1
摘要
数字笔迹——即来自笔尖或触摸输入捕获的坐标流——缺乏统一的表征方式。连续的向量表征会产生冗长的序列并在训练过程中不稳定,而现有的分词表征要求大型词表,面临词表外问题,且在识别任务上不如向量表征有效。我们提出 ScribeTokens,一种将笔移动分解为单位像素步进的分词方法。该方法配合两个笔状态分词,即可用固定的 10 词表基表示任意数字笔迹,并实现激进的 BPE 压缩。在手写文本生成任务上,ScribeTokens 显著优于向量表征(70.29% vs 17.33% 的字符错误率),显示出分词在生成任务中远远优于向量。在识别任务上,ScribeTokens 是唯一一种在不使用预训练的情况下就能超越向量表征的分词方法。我们进一步引入 next-ink-token 预测作为自监督预训练策略,该策略在所有基于分词的模型上均能一致性地提升识别效果,并可加快收敛速度最高可达 83 倍。经过预训练后,ScribeTokens 在两个数据集上实现了最佳的识别结果(IAM 数据集上 8.27% 的字符错误率,DeepWriting 数据集上 9.83% 的字符错误率)。
引用
@article{arxiv.2603.02805,
title = {ScribeTokens: Fixed-Vocabulary Tokenization of Digital Ink},
author = {Douglass Wang},
journal= {arXiv preprint arXiv:2603.02805},
year = {2026}
}