中文

低资源语言环境下的多语言多模态大语言模型

计算与语言 2026-05-19 v1

摘要

多模态大语言模型正从视觉-语言向三模态演进,能够看到、听到和读取文本,但管道和基准测试仍以英语为中心且计算负担沉重。本教程为多语言多模态研究提供概览,涵盖文本、语音和视觉,在有限数据和计算资源预算下进行多语言多模态处理,综合了基础理论、近期多语言模型(PALO、Maya)、语音-文本大语言模型。我们涵盖低成本的数据创建与精选;用于三模态对齐的适配器堆栈;超越英语的文化感知评估;以及用于微调紧凑型多语言视觉语言模型和构建语音->文本->大语言模型管道的实用资源。内容将以互动式半天教程形式呈现,面向在低资源语言环境中从事多语言多模态AI研究和实践的研究人员和从业者。

关键词

引用

@article{arxiv.2605.17152,
  title  = {Multilingual and Multimodal LLMs in the Wild: Building for Low-Resource Languages},
  author = {Firoj Alam and Shammur Absar Chowdhury and Enamul Hoque Prince},
  journal= {arXiv preprint arXiv:2605.17152},
  year   = {2026}
}

备注

Multimodal Foundation Models, Large Language Models, Native, Multilingual, Language Diversity, Low-resources-language