NileChat:面向本地社区的多样化语言与文化感知LLM
计算与语言
2025-09-24 v3
摘要
提升大语言模型(LLM)的语言能力以涵盖低资源语言是一个关键研究领域。当前研究方向主要依赖将英语语料库翻译生成的合成数据,尽管展现了有前景的语言理解和翻译能力,但往往导致模型与源语言文化对齐。这些模型常常无法代表本地社区的文化遗产和价值观。本工作提出了一种方法,为特定社区创建合成和检索增强的预训练数据,考虑其(i)语言,(ii)文化遗产,以及(iii)文化价值观。我们以埃及和摩洛哥方言作为测试平台进行验证,因其语言和文化丰富性以及在LLM中目前的代表性不足。作为概念验证,我们开发了NileChat,一个3B参数的埃及和摩洛哥阿拉伯语LLM,专为埃及和摩洛哥社区适配,融合了其语言、文化遗产和价值观。我们在各种理解、翻译以及文化和价值观对齐基准上的结果表明,NileChat在同等规模下优于现有的阿拉伯语感知LLM,并与更大模型表现相当。本工作以受控合成数据生成和检索增强预训练为手段,聚焦阿拉伯语方言在LLM中的文化和价值观对齐,涵盖摩洛哥Darija、埃及阿拉伯语及Arabizi变体,推动低资源社区的阿拉伯语NLP发展。我们与社区共享方法、数据和模型,以促进更多样化社区在文化LLM开发中的纳入与覆盖:https://github.com/UBC-NLP/nilechat。
引用
@article{arxiv.2505.18383,
title = {NileChat: Towards Linguistically Diverse and Culturally Aware LLMs for Local Communities},
author = {Abdellah El Mekki and Houdaifa Atou and Omer Nacar and Shady Shehata and Muhammad Abdul-Mageed},
journal= {arXiv preprint arXiv:2505.18383},
year = {2025}
}
备注
Accepted to EMNLP 2025 (Main Conference). Camera-ready version. Data & models: https://github.com/UBC-NLP/nilechat