中文

用文化知识接地多语言多模态大语言模型

计算与语言 2025-08-13 v2 机器学习

摘要

多模态大语言模型在高资源环境下表现出色,但常常误解长尾文化实体,并在低资源语言中表现不佳。为了解决这一差距,我们提出了一种以数据为中心的方法,直接将MLLM植根于文化知识。利用来自Wikidata的大规模知识图谱,我们收集代表重要文化实体的图像,并生成合成的多语言视觉问答数据。由此产生的数据集CulturalGround包含2200万个高质量、文化丰富的VQA对,涵盖42个国家和39种语言。我们在CulturalGround上训练了开源MLLM CulturalPangea,并穿插了标准的多语言指令微调数据以保持通用能力。CulturalPangea在各种以文化为中心的多语言多模态基准测试中,在开放模型中实现了最先进的性能,平均优于先前模型5.0%,同时不降低主流视觉语言任务的结果。我们的发现表明,这种有针对性的、文化接地的方法可以显著缩小MLLM中的文化差距,并为实现全球包容的多模态系统提供一条实用路径。

关键词

引用

@article{arxiv.2508.07414,
  title  = {Grounding Multilingual Multimodal LLMs With Cultural Knowledge},
  author = {Jean de Dieu Nyandwi and Yueqi Song and Simran Khanuja and Graham Neubig},
  journal= {arXiv preprint arXiv:2508.07414},
  year   = {2025}
}