面向大型视觉 - 语言模型识别的在线手写表示
计算机视觉与模式识别
2024-02-26 v1 人工智能
机器学习
摘要
配备触摸屏和手写板的平板电脑日益普及,其关键功能是将手写转换为文本,从而实现搜索、索引和 AI 辅助。与此同时,视觉 - 语言模型 (VLMs) 凭借其在各种任务中的最先进 (SOTA) 性能,以及训练、微调和推理方法的统一简便性,已成为图像理解的首选方案。虽然 VLMs 在基于图像的任务上表现优异,但若天真地应用(即把手写渲染为图像并执行光学字符识别 (OCR)),它们在手写识别方面表现不佳。在本文中,我们研究利用 VLMs 进行在线手写识别,超越了天真的 OCR 方法。我们提出了一种新颖的数字墨水(在线手写)令牌化表示,既包含按时间顺序排列的笔画序列作为文本,也包含作为图像的表示。我们表明,这种表示产生的结果可与最先进的在线手写识别器相媲美甚至更优。通过在多个公共数据集上使用两个不同的 VLM 家族得出的结果,展示了其广泛的适用性。我们的方法可应用于现成的 VLMs,无需更改其架构,并可用于微调和参数高效微调。我们进行了详细的消融研究,以确定所提出表示的关键要素。
引用
@article{arxiv.2402.15307,
title = {Representing Online Handwriting for Recognition in Large Vision-Language Models},
author = {Anastasiia Fadeeva and Philippe Schlattner and Andrii Maksai and Mark Collier and Efi Kokiopoulou and Jesse Berent and Claudiu Musat},
journal= {arXiv preprint arXiv:2402.15307},
year = {2024}
}