Chronicles-OCR:面向汉字演化轨迹的跨时代感知基准
计算机视觉与模式识别
2026-05-13 v1
摘要
视觉大语言模型(Vision Large Language Models, VLLMs)在现代富含文本的视觉理解中取得了显著成功。然而,面对历史书写系统持续的形态演变,其感知鲁棒性在很大程度上仍未被探索。现有的古代文本数据集通常聚焦于孤立的历史时期,未能捕捉到跨越数千年的系统性视觉分布偏移。为了弥合这一差距并赋能数字人文,我们引入了 Chronicles-OCR,这是首个专门设计用于评估 VLLMs 在汉字完整演化轨迹(即汉字七体)上跨时代视觉感知能力的综合基准。该数据集与顶尖机构领域专家合作策划,包含 2800 张严格平衡的图像,涵盖从龟甲到纸质书法的极其多样的物理介质。为了适应不同历史阶段剧烈的形态和拓扑变化,我们提出了一种新颖的阶段自适应标注范式。基于此,Chronicles-OCR 制定了四项严格的定量任务:跨时期字符定位、通过视觉指代的细粒度古文字识别、古代文本解析以及字体分类。通过将视觉感知与语义推理隔离开来,Chronicles-OCR 提供了一个权威平台,以揭示当前 VLLM 的局限性,为鲁棒的、具有演化意识的历史文本感知铺平道路。Chronicles-OCR 已公开于 https://github.com/VirtualLUOUCAS/Chronicles-OCR。
引用
@article{arxiv.2605.11960,
title = {Chronicles-OCR: A Cross-Temporal Perception Benchmark for the Evolutionary Trajectory of Chinese Characters},
author = {Gengluo Li and Shangpin Peng and Xingyu Wan and Chengquan Zhang and Hao Feng and Xin Xu and Pian Wu and Bang Li and Zengmao Ding and Yongge Liu and Yipei Ye and Yang Yang and Zhan Shu and Guojun Yan and Zhe Li and Can Ma and Weiping Wang and Yu Zhou and Han Hu},
journal= {arXiv preprint arXiv:2605.11960},
year = {2026}
}