通过组件绑定的多模态知识增强 specialized 大模型用于甲骨文解释
计算机视觉与模式识别
2026-04-09 v1 计算与语言
摘要
解读古代中国甲骨文(OBS)是一项具有挑战性的任务,可洞察古代时代的信仰、系统和文化。现有方法将解读视为封闭式图像识别问题,无法弥合“解释鸿沟”:尽管单个字符往往独特且罕见,但由有限集合的重复性、象形组件构成,这些组件携带可迁移的语义含义。为利用这种结构逻辑,我们提出一种代理驱动的视觉-语言模型(VLM)框架,将 VLM 用于精确视觉定位,集成 LLM-based 代理以自动化组件识别、图基知识检索和关系推断的推理链,以实现语言学上准确的解释。为支持此框架,我们还引入了 OB-Radix 数据集,提供了先前语料库中缺失的结构和语义数据,包含 1,022 个字符图像(934 个独特字符)和 1,853 幅细粒度组件图像,覆盖 478 个独特组件并附有验证解释。通过在三个不同任务的基准测试中评估,我们展示了该框架相较于基线方法可实现更详尽且更精确的解读。
引用
@article{arxiv.2604.06711,
title = {Specializing Large Models for Oracle Bone Script Interpretation via Component-Grounded Multimodal Knowledge Augmentation},
author = {Jianing Zhang and Runan Li and Honglin Pang and Ding Xia and Zhou Zhu and Qian Zhang and Chuntao Li and Xi Yang},
journal= {arXiv preprint arXiv:2604.06711},
year = {2026}
}