中文

评估视觉与文化解释:K-Viscuit基准测试的人类-VLM协作

计算与语言 2025-06-02 v3 计算机视觉与模式识别

摘要

为了构建具有文化包容性的视觉语言模型(VLM),发展测试其解决与文化相关问题能力的基准测试至关重要。现有方法通常依赖人类标注员,导致过程代价高昂,且在生成多样化问题时给标注员带来认知负担。为此,我们提出了一种半自动化的文化VLM基准测试构建框架,具体针对多选问答。该框架结合人类-VLM协作,其中VLM根据指导方针、少量已标注示例和相关知识生成问题,随后由母语者进行验证。我们通过构建聚焦于韩国文化的 \texttt{K-Viscuit} 数据集,展示了该框架的有效性。我们在该数据集上的实验表明,开源模型在理解韩国文化方面落后于专有模型,揭示了关键改进领域。我们还 presented一系列进一步分析,包括人类评估、增强VLM外部知识,以及超越多选问答的评估。该数据集可在 https://huggingface.co/datasets/ddehun/k-viscuit 获取。

关键词

引用

@article{arxiv.2406.16469,
  title  = {Evaluating Visual and Cultural Interpretation: The K-Viscuit Benchmark with Human-VLM Collaboration},
  author = {ChaeHun Park and Yujin Baek and Jaeseok Kim and Yu-Jung Heo and Du-Seong Chang and Jaegul Choo},
  journal= {arXiv preprint arXiv:2406.16469},
  year   = {2025}
}

备注

ACL 2025 camera-ready