面向所有人的 LLM:在大型语言模型中表征未被充分代表的语言
计算与语言
2024-09-24 v1 人工智能
摘要
自然语言处理(NLP)见证了大型语言模型(LLM)在众多任务中表现优异所带来的深远影响。然而,LLM 在多语言环境中的局限性,尤其是在未被充分代表的语言中,仍然是一个重大障碍。本论文旨在通过关注未被充分代表的语言来弥合 NLP 研究与开发中的差距。我们对 LLM 进行了全面评估,以考察它们在这些语言中的能力,揭示了多语言和多文化泛化的挑战。针对多语言泛化差距,本论文提出了数据与计算高效的方法,以缓解 LLM 在未被充分代表语言上的能力差距,从而在不损失任务泛化能力的情况下,在未被充分代表语言上实现更好的泛化。所提出的解决方案涵盖跨语言连续指令微调、基于检索的跨语言上下文学习以及上下文查询对齐。此外,还提出了一种衡量在不同语言下运行的 LLM 之间文化价值观对齐的新方法,以确保文化敏感性和包容性。这些贡献旨在增强 LLM 在未被充分代表语言中的多语言和多文化对齐,最终推动 NLP 领域向更大的平等和包容性发展。
引用
@article{arxiv.2409.13897,
title = {LLM for Everyone: Representing the Underrepresented in Large Language Models},
author = {Samuel Cahyawijaya},
journal= {arXiv preprint arXiv:2409.13897},
year = {2024}
}
备注
PhD thesis