超越单字:评估 MLLM 的句子级甲骨文理解能力
密码学与安全
2026-06-30 v1 机器学习
摘要
现有的 AI 辅助甲骨文(OBI)视觉识别与理解研究主要聚焦于字符级,忽略了完整卜辞中蕴含的长文本连贯性与上下文依赖。近期,多模态大型语言模型(MLLM)强大的视觉感知能力为 OBI 信息处理开辟了新可能。在本工作中,我们引入 S-OBI,一个用于评估 MLLM 句子级 OBI 理解能力的新型基准。S-OBI 不使用噪声多且不完整的拓片作为视觉输入,而是通过字形替换与组合合成清晰、标准化的句子级 OBI 实例。根据 95 份经专家识别、校正与验证的带翻译原始拓片,我们将原始拓片中的字符替换为来自现有 OBI 数据集的对应干净字形样本,同时保持整体铭文结构与语义组织。这减轻了低层失真的影响,从而能够更专注地评估句子级 OBI 理解。在此基础上,我们设计了语义匹配、语义槽抽取和上下文推理任务,并获得了 695 个问答对。实验揭示了当代 MLLM 在句子级 OBI 理解上的不足。特别是,未掩码区域的视觉感知错误在推理链中传播,导致对掩码字符的错误预测,这表明当前模型对句子级 OBI 的理解仍强烈依赖于字符级识别。总体而言,S-OBI 提供了一个诊断基准,用于评估 MLLM 能否超越孤立的字符识别,迈向结构化的铭文级理解。
引用
@article{arxiv.2606.31168,
title = {Probe Choice Changes Canary-Memorization Verdicts: Three Post-Hoc Disagreement Case Studies in a Text-Dominant LoRA-Tuned Autoregressive Testbed},
author = {Zhichao Fan and Zexin Zhuang and Yanhang Li},
journal= {arXiv preprint arXiv:2606.31168},
year = {2026}
}
备注
ICML 2026 FoGen Workshop camera-ready. 17 pages, 4 figures, 12 tables