为何LLaVA视觉语言模型会以英文回复图像?
计算与语言
2024-07-03 v1 计算机视觉与模式识别
摘要
我们发现了流行的多模态视觉语言模型(VLM)中出现的惊人多语言偏差。包括图像的查询会显著增加LLaVA式VLM返回英文响应的概率,无论查询语言为何。本文采用两种方法进行调查:结合广泛的设计空间消融实验和对模型内部表示的机制性分析。两种方法均表明问题源于LLaVA模型的语言建模组件。统计上,我们发现更换为双语语言模型的语言 backbone对减少此错误影响最大。机制上,我们提供 compelling证据表明视觉输入未被映射到与文本相同的空间,干预中间注意力层可减少此偏差。我们的发现为研究者和工程师提供了重要见解,以理解多模态与多语言空间之间的交叉,促进开发适用于非英语环境的有能力且包容的VLM。
引用
@article{arxiv.2407.02333,
title = {Why do LLaVA Vision-Language Models Reply to Images in English?},
author = {Musashi Hinck and Carolin Holtermann and Matthew Lyle Olson and Florian Schneider and Sungduk Yu and Anahita Bhiwandiwalla and Anne Lauscher and Shaoyen Tseng and Vasudev Lal},
journal= {arXiv preprint arXiv:2407.02333},
year = {2024}
}
备注
Pre-print