低资源语言的多模态大型语言模型:巴斯克语案例研究
计算与语言
2026-03-05 v2 人工智能
摘要
当前的多模态大型语言模型在several 任务上表现优异。虽然商业 MLLM 在低资源语言上可接受,但在开源社区中难以达到相当水平。本文旨在为低资源语言——即巴斯克语开发强大的 MLLM。为此,我们自行开发了训练和评估图像-文本数据集。使用两种不同的大型语言模型作为底层模型:Llama-3.1-Instruct 模型和一个被改进的巴斯克语变体 Latxa,我们探索了多种训练数据混合方式。我们展示了:i) 巴斯克语 multimodal 数据的低比例(约 20%)即可在巴斯克语基准测试中获得稳健结果,ii) 与预期相反,巴斯克语指令底层 LLM 并非必需即可获得在巴斯克语中表现良好的 MLLM。我们的结果为通过开放方式发布我们的资源,为开发其他低资源语言的 MLLM 铺平了道路。
引用
@article{arxiv.2511.09396,
title = {Multimodal Large Language Models for Low-Resource Languages: A Case Study for Basque},
author = {Lukas Arana and Julen Etxaniz and Ander Salaberria and Gorka Azkune},
journal= {arXiv preprint arXiv:2511.09396},
year = {2026}
}