中文

Hanfu-Bench:跨时代文化理解与文化转创的多模态基准

计算与语言 2025-09-30 v3 计算机视觉与模式识别

摘要

文化是一个丰富且动态的领域,随地理和时间而演变。然而,现有关于视觉语言模型(VLMs)文化理解的研究主要强调地理多样性,往往忽视了关键的时间维度。为了弥合这一差距,我们引入了 Hanfu-Bench,一个由专家精心策划的新型多模态数据集。汉服作为跨越中国古代各朝代的传统服饰,是反映中国文化深厚时间维度的代表性文化遗产,同时在当代中国社会依然极具流行度。Hanfu-Bench 包含两个核心任务:文化视觉理解和文化图像转创。前者通过多项选择视觉问答,考察基于单图或多图输入的时代文化特征识别;后者则侧重于通过文化元素传承和现代语境适应,将传统服饰转化为现代设计。我们的评估表明,闭源 VLM 在视觉文化理解上的表现与非专家相当,但比人类专家低 10%,而开源 VLM 则进一步落后于非专家。对于转创任务,多维度的人类评估表明,表现最佳的模型成功率仅为 42%。我们的基准提供了一个重要的试验平台,揭示了这一时间文化理解与创造性改编新方向上的重大挑战。

关键词

引用

@article{arxiv.2506.01565,
  title  = {Hanfu-Bench: A Multimodal Benchmark on Cross-Temporal Cultural Understanding and Transcreation},
  author = {Li Zhou and Lutong Yu and Dongchu Xie and Shaohuan Cheng and Wenyan Li and Haizhou Li},
  journal= {arXiv preprint arXiv:2506.01565},
  year   = {2025}
}

备注

Cultural Analysis, Cultural Visual Understanding, Cultural Image Transcreation. Accepted by EMNLP 2025 (Oral)