中文

MlingConf:大语言模型上多语言置信度估计的全面研究

计算与语言 2024-10-21 v2

摘要

大语言模型(LLM)生成幻觉的倾向性引发了可靠性 concerns。因此,反映生成可信度程度的置信度估计变得至关重要。然而,当前在英语之外的语言中,大语言模型的置信度估计仍未得到充分探索。本文通过引入多语言置信度估计(MlingConf)来弥补这一差距,专注于语言无关(LA)和语言特定(LS)任务,以探讨多语言置信度估计在不同任务上的性能和语言主导效应。该基准包括四个经过严格核对并由人类评估的高质量多语言数据集,用于LA任务,以及一个针对特定语言社会、文化和地理背景的LS任务。我们的实验结果表明,在LA任务中,英语在置信度估计中显示出显著的语言主导优势;而在LS任务中,使用与问题相关的语言提示大语言模型在多语言置信度估计中表现出更好的语言主导性。这些现象启发我们采用面向LS任务的特定语言提示策略,以提升大语言模型在LS任务上的可靠性和准确性。

关键词

引用

@article{arxiv.2410.12478,
  title  = {MlingConf: A Comprehensive Study of Multilingual Confidence Estimation on Large Language Models},
  author = {Boyang Xue and Hongru Wang and Rui Wang and Sheng Wang and Zezhong Wang and Yiming Du and Bin Liang and Kam-Fai Wong},
  journal= {arXiv preprint arXiv:2410.12478},
  year   = {2024}
}

备注

Comments: This work was intended as a replacement of arXiv:2402.13606 and any subsequent updates will appear there