中文

Appear2Meaning:一个面向从图像推断结构化文化元数据的跨文化基准

计算机视觉与模式识别 2026-04-09 v1 计算与语言 多媒体

摘要

视觉语言模型(VLMs)的最新进展改善了文化遗产的图像描述。然而,从视觉输入推断结构化文化元数据(如创作者、来源、时期)仍未得到充分探索。我们为此任务引入了一个多类别、跨文化的基准,并使用 LLM-as-Judge 框架评估 VLMs,该框架衡量与参考标注的语义对齐程度。为了评估文化推理,我们在文化区域之间报告精确匹配、部分匹配和属性级别的准确率。结果表明,模型捕捉到碎片化的信号,并且在不同文化和元数据类型之间表现出显著的性能差异,导致不一致且依据不足的预测。这些发现凸显了当前 VLMs 在超越视觉感知的结构化文化元数据推断方面的局限性。

关键词

引用

@article{arxiv.2604.07338,
  title  = {Appear2Meaning: A Cross-Cultural Benchmark for Structured Cultural Metadata Inference from Images},
  author = {Yuechen Jiang and Enze Zhang and Md Mohsinul Kabir and Qianqian Xie and Stavroula Golfomitsou and Konstantinos Arvanitis and Sophia Ananiadou},
  journal= {arXiv preprint arXiv:2604.07338},
  year   = {2026}
}