中文

罗塞塔:基于情境学习的开放词汇文本与符号识别

计算机视觉与模式识别 2025-04-10 v1

摘要

我们提出了罗塞塔(Rosetta),一种多模态模型,利用多模态情境学习(Multimodal In-Context Learning, MICL)来分类文档中新颖脚本模式的序列,通过利用最小示例实现,从而无需显式重新训练。为增强情境学习能力,我们设计了确保不同程度情境信息性的dataset生成过程,提高了模型在不同情境下的适应性。我们方法的关键优势在于采用情境感知标记器(Context-Aware Tokenizer, CAT),其 enables 开放词汇分类。这使得模型能够对文本和符号模式进行无限制类别的分类,将其分类能力扩展到训练字母表模式的范围之外。结果 unlocks 应用,如新字母和语言的识别。在合成数据集上的实验表明,罗塞塔有潜力成功分类离群点(Out-Of-Distribution)视觉模式和多样化的字母表和脚本,包括但不限于中文、希腊文、俄语、法语、西班牙文和日文。

关键词

引用

@article{arxiv.2504.06841,
  title  = {Classifying the Unknown: In-Context Learning for Open-Vocabulary Text and Symbol Recognition},
  author = {Tom Simon and William Mocaer and Pierrick Tranouez and Clement Chatelain and Thierry Paquet},
  journal= {arXiv preprint arXiv:2504.06841},
  year   = {2025}
}

备注

Submitted to ICDAR 2025