中文

面向提示优化的大型语言模型不确定性基准测试

地球与行星天体物理 2024-09-17 v1 天体物理仪器与方法

摘要

大型语言模型(LLM)的提示优化算法在多步骤推理方面表现出色,但仍缺乏有效的不确定性估计。本文引入一个基准数据集,用于评估不确定性指标,聚焦于答案不确定性、正确性不确定性、Aleatoric不确定性和Epistemic不确定性。通过对GPT-3.5-Turbo和Meta-Llama-3.1-8B-Instruct等模型的分析,我们发现当前指标更倾向于答案不确定性,即反映输出置信度和多样性,而非正确性不确定性,这凸显了需要改进的指标,以更好地引导提示优化,使其具有优化目标意识。我们的代码和数据集可在https://github.com/0Frett/PO-Uncertainty-Benchmarking 获取。

关键词

引用

@article{arxiv.2409.10043,
  title  = {Lunar References Systems, Frames and Time-scales in the context of the ESA Programme Moonlight},
  author = {Agnes Fienga and Nicolas Rambaux and Krzysztof Sosnica},
  journal= {arXiv preprint arXiv:2409.10043},
  year   = {2024}
}

备注

Appendix of the ATLAS Concept document ESA contract AO/1-10712/21/NL/CRS