百语言大型视觉语言模型的多语言能力驱动因素研究
计算与语言
2025-01-10 v1 计算机视觉与模式识别
摘要
目前大多数大型视觉语言模型(LVLMs)主要在英语数据上进行训练,导致它们难以理解非英语输入,无法生成所需的目标语言输出。现有方法通过添加多语言训练数据来缓解这些问题,但往往以非系统性方式进行,缺乏对不同训练混合方式如何影响不同语言群体的洞察。本文对大规模多语言LVLMs的训练策略进行全面研究。首先,我们进行一系列跨越13个下游视觉语言任务和43种语言的多阶段实验,系统性地检验:(1)在不降低英语性能的前提下可以包含多少种训练语言;(2)预训练和指令微调数据的最优语言分布。进一步,我们(4)研究如何提高多语言文本图像理解能力,并提出一种新基准。意外的是,我们的分析显示:(i)可以同时包含最多100种训练语言;(ii)仅需25-50%的非英语数据,即可大幅提升多语言性能,同时保持强大的英语性能。我们进一步发现,将非英语OCR数据纳入预训练和指令微调对于提高多语言文本图像理解至关重要。最后,我们将所有发现整合起来,训练了Centurio——一个覆盖100种语言的LVLM,在覆盖14项任务和56种语言的评估中实现了最先进的性能。
引用
@article{arxiv.2501.05122,
title = {Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model},
author = {Gregor Geigle and Florian Schneider and Carolin Holtermann and Chris Biemann and Radu Timofte and Anne Lauscher and Goran Glavaš},
journal= {arXiv preprint arXiv:2501.05122},
year = {2025}
}