中文

跨文化专家级艺术评论评估基准

计算与语言 2026-02-26 v3

摘要

视觉语言模型(VLMs)在视觉描述方面表现出色,但在文化解释方面尚未得到充分验证。现有基准仅评估感知,不涉及解释;且常用的自动化指标和LLM评判平均值对文化敏感的生成任务不可靠。我们提出基于艺术理论构建的三层评估框架(第2节),通过五个层次(L1--L5)和165个文化特定维度实现文化理解(涵盖六大艺术传统)。Tier I计算自动质量指标,Tier II采用基于评语的单评委打分,Tier III通过Sigmoid校准将综合分数校准至人类专家评分。应用于15个VLMs的294个评估对,结果表明:(i)自动化指标和评委打分测量的是不同构量,单评委校准更可靠;(ii)文化理解随着从视觉描述(L1--L2)到文化解释(L3--L5)的转变而下降;(iii)西方艺术样本 consistently 获得更高分数。本文首创针对生成式艺术评论的跨文化评估工具,提供可复现的VLM文化能力审计方法。框架代码已开源于https://github.com/yha9806/VULCA-Framework。

关键词

引用

@article{arxiv.2601.07984,
  title  = {Cross-Cultural Expert-Level Art Critique Evaluation with Vision-Language Models},
  author = {Haorui Yu and Xuehang Wen and Fengrui Zhang and Qiufeng Yi},
  journal= {arXiv preprint arXiv:2601.07984},
  year   = {2026}
}

备注

16 pages, 7 figures, submitted to ACL 2026