中文

低资源语言的多模态大型语言模型:巴斯克语案例研究

计算与语言 2026-03-05 v2 人工智能

摘要

当前的多模态大型语言模型在several 任务上表现优异。虽然商业 MLLM 在低资源语言上可接受,但在开源社区中难以达到相当水平。本文旨在为低资源语言——即巴斯克语开发强大的 MLLM。为此,我们自行开发了训练和评估图像-文本数据集。使用两种不同的大型语言模型作为底层模型:Llama-3.1-Instruct 模型和一个被改进的巴斯克语变体 Latxa,我们探索了多种训练数据混合方式。我们展示了:i) 巴斯克语 multimodal 数据的低比例(约 20%)即可在巴斯克语基准测试中获得稳健结果,ii) 与预期相反,巴斯克语指令底层 LLM 并非必需即可获得在巴斯克语中表现良好的 MLLM。我们的结果为通过开放方式发布我们的资源,为开发其他低资源语言的 MLLM 铺平了道路。

关键词

引用

@article{arxiv.2511.09396,
  title  = {Multimodal Large Language Models for Low-Resource Languages: A Case Study for Basque},
  author = {Lukas Arana and Julen Etxaniz and Ander Salaberria and Gorka Azkune},
  journal= {arXiv preprint arXiv:2511.09396},
  year   = {2026}
}