中文

MELLA:面向低资源语言 MLLMs 的语言能力与文化 grounding 融合

计算机视觉与模式识别 2025-12-10 v1 人工智能 计算与语言

摘要

多模态大语言模型(MLLMs)在高资源语言上表现突出,但在低资源语言情境下效果显著下降。当前的多语言增强方法多限于文本模态,或仅依赖机器翻译。虽然这些方法有助于模型获得基本语言能力并生成“浅层描述”,但忽视了多模态信息性和文化 grounding 的重要性,这两者都是服务低资源语言用户的关键。为弥合这一差距,本研究识别出两个对低资源语言环境下真正有效 MLLM 至关重要的目标,即 1)语言能力,2)文化 grounding,尤其强调文化意识。为实现这两个目标,我们提出一种双源策略,引导为每个目标收集定制化数据,分别来源于原生网页 alt-text 用于文化,以及 MLLM 生成的描述用于语言能力。作为具体实现,我们引入 MELLA,一个多模态、多语言数据集。实验结果表明,在 MELLA 上微调后,八种语言的各种 MLLM 主干模型普遍性能提升,模型生成了“深层描述”。我们验证,性能提升来源于文化知识增强与语言能力增强。数据集可在 https://opendatalab.com/applyMultilingualCorpus 访问。

关键词

引用

@article{arxiv.2508.05502,
  title  = {MELLA: Bridging Linguistic Capability and Cultural Groundedness for Low-Resource Language MLLMs},
  author = {Yufei Gao and Jiaying Fei and Nuo Chen and Ruirui Chen and Guohang Yan and Yunshi Lan and Botian Shi},
  journal= {arXiv preprint arXiv:2508.05502},
  year   = {2025}
}