用于在线手写文本分类的自监督表示学习
机器学习
2023-10-11 v1 计算与语言
摘要
自监督学习提供了一种高效的方式,可从各类无标注数据中提取丰富表示,同时避免标注大规模数据集的成本。这可以通过设计预文本任务,针对数据的模态与领域生成伪标签来实现。鉴于在线手写文本应用的不断发展,本研究提出新颖的笔画部分掩码(Part of Stroke Masking, POSM)作为预训练模型的预文本任务,以从英汉两种语言的个人在线手写中提取信息性表示,并给出两条用于微调预训练模型的流程。为评估所提取表示的质量,我们采用内在与外在两种评价方法。预训练模型经微调后在书写者识别、性别分类和利手分类等任务上取得了最先进(SOTA)结果,同时也凸显了使用预训练模型相对于从头训练模型的优越性。
引用
@article{arxiv.2310.06645,
title = {Self-Supervised Representation Learning for Online Handwriting Text Classification},
author = {Pouya Mehralian and Bagher BabaAli and Ashena Gorgan Mohammadi},
journal= {arXiv preprint arXiv:2310.06645},
year = {2023}
}