中文

参数高效多模态指令微调用于罗马尼亚语视觉语言模型

计算与语言 2025-12-18 v1 人工智能 机器学习

摘要

关注低资源语言是实现生成式AI民主化的关键步骤。在本工作中,我们为罗马尼亚语贡献了缩小多模态NLP资源差距的方法。我们将广泛使用的Flickr30k数据集翻译成罗马尼亚语,并通过利用开源LLMs进一步扩展其用于视觉问答。我们通过微调开源VLM在罗马尼亚视觉问答任务上展示了数据集的实用性。我们从三个广泛使用的模型家族中选择了VLM:LLaMA 3.2、LLaVA 1.6和Qwen2。对于微调,我们采用了参数高效的LoRA方法。我们的模型在视觉问答方面展示了改进的罗马尼亚语能力,以及在未训练的任务上,如罗马尼亚语图像描述生成。七参数规模的Qwen2-VL-RoVQA在两个任务上取得了最高分数,相比原始版本BERTScore F1分别提升了+6.05%和+2.61%。最后,模型与原始形式相比表现出显著的语法错误减少,表明不仅在语言理解方面而且在罗马尼亚语流利度方面都有改进。

关键词

引用

@article{arxiv.2512.14926,
  title  = {Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models},
  author = {George-Andrei Dima and Dumitru-Clementin Cercel},
  journal= {arXiv preprint arXiv:2512.14926},
  year   = {2025}
}