语言特定层 matters:大型视觉语言模型的高效多语言增强
计算与语言
2025-08-27 v1
摘要
大型视觉语言模型(LVLMs)在理解视觉信息方面展现出惊人的能力,但也表现出在多语言能力上的不平衡。在本工作中,我们深入探讨了LVLMs的多语言工作模式,识别出LVLMs的多语言理解能力与浅层语言特定神经元激活之间存在显著相关性。基于这一洞见,我们引入了PLAST(Precise LAnguage-Specific layers fine-Tuning),这是一种实现LVLMs高效多语言增强的训练方法。PLAST首先通过监控语言特定神经元激活来识别参与多语言理解的层,然后使用问答翻译对来实现多语言对齐。我们的实验结果在MM-Bench和MMMB上都表明,PLAST有效提升了LVLMs的多语言能力,仅调参14%即可实现显著的效率。进一步分析显示,PLAST可以推广到低资源和复杂视觉推理任务,促进了浅层的语言特定视觉信息参与。
引用
@article{arxiv.2508.18381,
title = {Language-Specific Layer Matters: Efficient Multilingual Enhancement for Large Vision-Language Models},
author = {Yuchun Fan and Yilin Wang and Yongyu Mu and Lei Huang and Bei Li and Xiaocheng Feng and Tong Xiao and Jingbo Zhu},
journal= {arXiv preprint arXiv:2508.18381},
year = {2025}
}
备注
Accepted by EMNLP 2025 findings