基于 LLaVA 框架的波兄语视觉语言模型注释高效适配
计算与语言
2026-02-18 v2 人工智能
摘要
大多数视觉语言模型 (VLM) 是在英语中心数据上训练的,这限制了其在其他语言和文化语境中的性能。这限制了非英语使用者的可用性,阻碍了反映多样语言和文化现实的多模态系统的开发。本文通过复现和适配 LLaVA-Next 方法,构建一套波兄语 VLM。我们依赖完全自动化的管道来翻译和过滤现有多模态数据集,并通过合成波兄语数据辅助 OCR 和文化特定任务。尽管几乎完全依赖自动翻译且对训练数据进行最小的人工干预,但我们的做法取得了优异的效果:我们在波兄语适配的 MMBench 上观察到相较于 LLaVA-1.6-Vicuna-13B 提升了 +9.5%,在生成式评估中还能获得更高质量的标题,人工标注者按语言正确性进行评估。这些发现表明,大规模自动翻译结合轻量级过滤,能够有效地为低资源语言引导高质量的多模态模型。仍存在一些挑战,特别是文化覆盖和评估方面。为促进进一步的研究,我们将我们的模型和评估数据集公开 disponibles。
引用
@article{arxiv.2602.14073,
title = {Annotation-Efficient Vision-Language Model Adaptation to the Polish Language Using the LLaVA Framework},
author = {Grzegorz Statkiewicz and Alicja Dobrzeniecka and Karolina Seweryn and Aleksandra Krasnodębska and Karolina Piosek and Katarzyna Bogusz and Sebastian Cygert and Wojciech Kusa},
journal= {arXiv preprint arXiv:2602.14073},
year = {2026}
}