中文

CalliReader:通过嵌入对齐视觉语言模型 contextualize 中文书法

计算机视觉与模式识别 2026-01-07 v2 多媒体

摘要

中文书法作为UNESCO遗产,因视觉模糊和文化复杂性而在计算领域具有挑战性。现有AI系统因标注数据有限和视觉语义对齐不足,难以对其复杂脚本进行 contextualization。我们提出CalliReader,一个视觉语言模型(VLM),通过三项创新措施解决中文书法 contextualization(CC2^2)问题:(1)按字符切片实现精确字符提取与排序;(2)CalliAlign 实现视觉-文本token的压缩与对齐;(3)嵌入指令调优(e-IT)提升对齐效果并缓解数据稀缺问题。我们还构建了CalliBench,即第一个针对全页书法 contextualization 的基准,旨在解决前述OCR和VQA方法中存在的三个关键问题:上下文碎片化、浅层推理和幻觉。通过大量实验(包括用户研究),我们验证了CalliReader在书法页面级识别与解释方面优于其他当前最先进的方法甚至人类专家,在提高准确率的同时显著降低幻觉率。与推理模型的比较突显了准确识别是可靠理解的必要前提。定量分析验证了CalliReader的高效性;在文档和真实世界基准上的评估确认了其强大的泛化能力。

关键词

引用

@article{arxiv.2503.06472,
  title  = {CalliReader: Contextualizing Chinese Calligraphy via an Embedding-Aligned Vision-Language Model},
  author = {Yuxuan Luo and Jiaqi Tang and Chenyi Huang and Feiyang Hao and Zhouhui Lian},
  journal= {arXiv preprint arXiv:2503.06472},
  year   = {2026}
}

备注

11 pages