中文

MlingConf:大语言模型多语言置信度估计的综合研究

计算与语言 2025-05-27 v4

摘要

大语言模型(LLMs)产生幻觉的倾向引发了对其可靠性的担忧。因此,能够指示生成内容可信程度的置信度估计变得至关重要。然而,当前在英语以外的语言中对LLM进行置信度估计的研究仍不充分。本文通过引入对LLM多语言置信度估计(MlingConf)的全面研究来填补这一空白,重点关注语言无关(LA)和语言特定(LS)任务,以探索多语言置信度估计在不同任务上的性能及语言主导效应。该基准包含四个经过精心核查和人工评估的高质量多语言数据集用于LA任务,以及一个针对特定语言的社会、文化和地理背景定制的LS任务数据集。我们的实验表明,在LA任务上,英语在置信度估计中表现出显著的语言主导性,而其他语言则较弱;在LS任务上,使用与问题相关的语言提示LLM在多语言置信度估计中表现出更好的语言主导性。这一现象启发了一种简单而有效的母语提示策略,即对LS任务使用语言特定的提示,从而有效提高LLM在LS场景中的可靠性和准确性。

关键词

引用

@article{arxiv.2402.13606,
  title  = {MlingConf: A Comprehensive Study of Multilingual Confidence Estimation on Large Language Models},
  author = {Boyang Xue and Hongru Wang and Rui Wang and Sheng Wang and Zezhong Wang and Yiming Du and Bin Liang and Wenxuan Zhang and Kam-Fai Wong},
  journal= {arXiv preprint arXiv:2402.13606},
  year   = {2025}
}

备注

Accepted in ACL2025 Findings