PictOBI-20k:大型多模态模型在象形甲骨字符视觉解读中的探索
计算机视觉与模式识别
2025-09-09 v1
摘要
甲骨文字(OBC)是人类最早确证的文字形式,理解其不仅是学者永恒的目标,也是理解人类早期生产方式的必由之路。当前甲骨字符解读方法主要受限于考古发掌的零星性质以及文本的有限性。随着大型多模态模型(LMM)在视觉感知方面的强大能力,利用 LMM 对 OBC 进行视觉解读的潜力日益凸显。本文引入 PictOBI-20k 数据集,用于评估 LMM 在象形甲骨字符视觉解读任务中的表现。该数据集包含 20,000 条精心收集的甲骨图像和真实物体图像,构成超过 15,000 个多选题。我们还进行了主观标注,以探讨人类与 LMM 在视觉推理中参考点的一致性。实验表明,通用 LMM 具备初步的视觉解读能力,但 LMM 在实际使用中并未有效利用视觉信息,往往受限于语言先验。我们希望本数据集能为未来面向 OBC 的 LMM 评估与优化提供帮助。代码和数据集将在 https://github.com/OBI-Future/PictOBI-20k 上公开。
关键词
引用
@article{arxiv.2509.05773,
title = {PictOBI-20k: Unveiling Large Multimodal Models in Visual Decipherment for Pictographic Oracle Bone Characters},
author = {Zijian Chen and Wenjie Hua and Jinhao Li and Lirong Deng and Fan Du and Tingzhu Chen and Guangtao Zhai},
journal= {arXiv preprint arXiv:2509.05773},
year = {2025}
}
备注
6 pages, 6 figures