面向大规模视觉语言模型的跨语言艺术品解释
计算与语言
2025-02-17 v2
摘要
随着大规模视觉语言模型 (LVLMs) 的性能不断提升,它们越来越 capable of responding in multiple languages,人们对 LVLMs 生成解释的需求也日益增长。然而,视觉编码器的预训练以及与视觉编码器集成的 LLM 训练主要使用英文训练数据,这使得我们不确定 LVLMs 在除英语之外的语言中是否能完全发挥潜能。此外,使用机器翻译创建的多语言 QA 框架存在文化差异和偏见,仍存在用于评估任务的缺陷。为解决这些挑战,本研究创建了一个不依赖机器翻译的多语言扩展数据集。该数据集考虑了细微差别和国家特定的措辞,然后用于评估 LVLMs 的生成解释能力。此外,本研究检验了资源丰富的英文指令调优是否能提高其他语言的性能。我们的发现表明,LVLMs 在除英语之外的语言表现较差于英语。此外,观察到 LVLMs 在有效管理来自英文数据的知识方面存在困难。我们的数据集可在 https://huggingface.co/datasets/naist-nlp/MultiExpArt 获取。
引用
@article{arxiv.2409.01584,
title = {Towards Cross-Lingual Explanation of Artwork in Large-scale Vision Language Models},
author = {Shintaro Ozaki and Kazuki Hayashi and Yusuke Sakai and Hidetaka Kamigaito and Katsuhiko Hayashi and Taro Watanabe},
journal= {arXiv preprint arXiv:2409.01584},
year = {2025}
}
备注
NAACL 2025 (Findings)