罗塞塔:基于情境学习的开放词汇文本与符号识别
计算机视觉与模式识别
2025-04-10 v1
摘要
我们提出了罗塞塔(Rosetta),一种多模态模型,利用多模态情境学习(Multimodal In-Context Learning, MICL)来分类文档中新颖脚本模式的序列,通过利用最小示例实现,从而无需显式重新训练。为增强情境学习能力,我们设计了确保不同程度情境信息性的dataset生成过程,提高了模型在不同情境下的适应性。我们方法的关键优势在于采用情境感知标记器(Context-Aware Tokenizer, CAT),其 enables 开放词汇分类。这使得模型能够对文本和符号模式进行无限制类别的分类,将其分类能力扩展到训练字母表模式的范围之外。结果 unlocks 应用,如新字母和语言的识别。在合成数据集上的实验表明,罗塞塔有潜力成功分类离群点(Out-Of-Distribution)视觉模式和多样化的字母表和脚本,包括但不限于中文、希腊文、俄语、法语、西班牙文和日文。
引用
@article{arxiv.2504.06841,
title = {Classifying the Unknown: In-Context Learning for Open-Vocabulary Text and Symbol Recognition},
author = {Tom Simon and William Mocaer and Pierrick Tranouez and Clement Chatelain and Thierry Paquet},
journal= {arXiv preprint arXiv:2504.06841},
year = {2025}
}
备注
Submitted to ICDAR 2025