面向中国古籍的视觉语言模型基准测试:从OCR到知识推理
计算与语言
2025-09-15 v1
摘要
中国古籍是保存千年中华历史文化宝贵资料的重要载体,涵盖众多领域的丰富知识,但在数字化和理解方面面临挑战,即传统方法仅扫描图像,而当前的视觉语言模型(VLM)在处理其视觉和语言复杂性方面困难。现有文档基准测试聚焦于英文印刷文本或简体中文,缺乏针对古籍中文的评估。为此,我们提出AncientDoc,即首个针对中国古籍的基准测试,旨在评估VLM从OCR到知识推理的能力。AncientDoc包含五个任务(页级OCR、 vernacular 翻译、基于推理的问答、基于知识的问答、语言变体问答),覆盖14种文档类型、100多部书籍和约3000页。基于AncientDoc,我们使用多种指标评估主流VLM,并辅以人类对齐的大型语言模型进行评分。
引用
@article{arxiv.2509.09731,
title = {Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning},
author = {Haiyang Yu and Yuchuan Wu and Fan Shi and Lei Liao and Jinghui Lu and Xiaodong Ge and Han Wang and Minghan Zhuo and Xuecheng Wu and Xiang Fei and Hao Feng and Guozhi Tang and An-Lan Wang and Hanshen Zhu and Yangfan He and Quanhuan Liang and Liyuan Meng and Chao Feng and Can Huang and Jingqun Tang and Bin Li},
journal= {arXiv preprint arXiv:2509.09731},
year = {2025}
}