中文

OBI-Bench:大型多模态模型在甲骨文研究中的能力评估

计算机视觉与模式识别 2025-02-12 v2 人工智能

摘要

我们提出 OBI-Bench,这是一个综合性基准,旨在系统评估大型多模态模型(LMM)在需要专家水平领域知识和深入思考的甲骨文(OBI)整体处理任务中的表现。OBI-Bench 包含 5,523 幅精心收集的多样化来源图像,涵盖五个关键领域问题:识别、重组、分类、检索和解读。这些图像跨越数个世纪的考古发现和数年的前线学者研究,包括从挖掘到合成的多阶段字体外观,如原甲骨、墨染本、甲骨碎片、裁剪单个字符和手工印刷字符。与现有基准不同,OBI-Bench 聚焦于 OBI 特定知识下的高级视觉感知与推理,挑战 LMM 执行类似专家所面临的任务。对 6 个专有 LMM 以及 17 个开源 LMM 的评估揭示了 OBI-Bench 所带来的重大挑战与需求。即使是 GPT-4o、Gemini 1.5 Pro 和 Qwen-VL-Max 最新版本在某些细粒度感知任务中仍远不如公众水平的人类。然而,在解读任务中表现出与未训练的人类相当的水平,表明其在提供新的解释性视角和生成创意推测方面具有显著能力。我们希望 OBI-Bench 能够促进社区发展针对古代语言研究的领域特定多模态基础模型,并深入探索这些未被充分发掘的 LMM 潜能。

关键词

引用

@article{arxiv.2412.01175,
  title  = {OBI-Bench: Can LMMs Aid in Study of Ancient Script on Oracle Bones?},
  author = {Zijian Chen and Tingzhu Chen and Wenjun Zhang and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2412.01175},
  year   = {2025}
}

备注

Accepted by ICLR 2025 as a Poster. 31 pages, 18 figures