中文

CArtBench:评估视觉语言模型在中国艺术理解、阐释与真伪判断上的能力

计算与语言 2026-05-26 v2

摘要

我们介绍 CARTBENCH,这是一个以博物馆为依托的基准,用于评估视觉语言模型(VLMs)在中国艺术品上的理解、阐释和真伪判断能力,超越短形式的识别和问答。CARTBENCH 包含四个子任务:CURATORQA 用于证据支撑下的识别与推理、CATALOGCAPTION 用于结构化的四部分专家式欣赏、REINTERPRET 用于经专家评分的可辩性重阐释,以及 CONNOISSEURPAIRS 用于在视觉相似混淆情况下的诊断性真伪判断。CARTBENCH 通过将带图片的故宫博物院对象与威克西数据中的权威目录页面对齐,涵盖多个朝代的五个艺术类别。我们在九个代表性 VLMs 上进行测试,发现高整体 CURATORQA 准确率可能掩盖了在硬证据链接和风格到时代推断上的显著下降;长篇欣赏距离专家参考仍有较大差距;而以真伪为导向的诊断性判别能力仍接近随机水平,这凸显了当前模型在从业水平推理方面的难度。

关键词

引用

@article{arxiv.2604.11632,
  title  = {CArtBench: Evaluating Vision-Language Models on Chinese Art Understanding, Interpretation, and Authenticity},
  author = {Xuefeng Wei and Zhixuan Wang and Xuan Zhou and Zhi Qu and Hongyao Li and Yusuke Sakai and Hidetaka Kamigaito and Taro Watanabe},
  journal= {arXiv preprint arXiv:2604.11632},
  year   = {2026}
}

备注

under review