中文

音素提示:增强大语言模型对非拉丁文字语言的多语言能力

计算与语言 2025-06-27 v3 人工智能 机器学习

摘要

尽管多语言大语言模型在各项基准测试中取得了显著性能,但我们发现,在当代大语言模型家族中,它们在非拉丁文字语言上的表现仍然不佳。这种差异源于大语言模型是在正字法脚本上进行预训练的,而正字法脚本以拉丁字符为主,掩盖了其与非拉丁文字共享的音系。我们提议利用音素转录作为互补信号,以诱导脚本不变的表征。我们的研究表明,整合音素信号能提升非拉丁文字和拉丁文字语言的性能,尤其对缩小两者之间的性能差距有显著影响。通过详细的实验,我们展示了音素和正字法脚本为上下文学习(ICL)检索到不同的示例。这激发了我们提出的混合ICL检索策略,其中来自两者的进一步聚合导致与随机ICL检索相比,拉丁文字语言(最高提升12.6%)和非拉丁文字语言(最高提升15.1%)的性能均有显著提升。

关键词

引用

@article{arxiv.2411.02398,
  title  = {Prompting with Phonemes: Enhancing LLMs' Multilinguality for Non-Latin Script Languages},
  author = {Hoang H Nguyen and Khyati Mahajan and Vikas Yadav and Julian Salazar and Philip S. Yu and Masoud Hashemi and Rishabh Maheshwary},
  journal= {arXiv preprint arXiv:2411.02398},
  year   = {2025}
}

备注

Accepted to NAACL 2025 (Main Conference). This version contains minor improvements to the camera-ready