大型语言模型中可估计不确定性的评估
计算与语言
2024-05-27 v1 人工智能
人机交互
摘要
可估计概率词(WEPs),如“可能”或“可能不是”,在自然语言中用于表达可估计的不确定性,与直接涉及数值概率的陈述相比更为常见。人类的可估计不确定性,以及其与数值估计的校准,长期以来一直是研究的领域——包括 CIA 等情报机构。本研究比较了大型语言模型(LLM)如 GPT-4 和 ERNIE-4 中的可估计不确定性,以及人类的可估计不确定性,以及它们之间的差异。我们展示了 GPT-3.5 和 GPT-4 在处理本文中呈现的某些 WEPs 时,能够与人类的估计相吻合,但并非所有情况。还观察到,当 LLM 被呈现包含性别化角色和中文语境时,会出现差异。进一步的研究表明,像 GPT-4 这样的高级 LLM 可以持续地在统计不确定性和可估计不确定性之间进行映射,但仍然存在显著的性能差距。结果为人类-LLM 对齐研究的不断增长的文献贡献了。
引用
@article{arxiv.2405.15185,
title = {An Evaluation of Estimative Uncertainty in Large Language Models},
author = {Zhisheng Tang and Ke Shen and Mayank Kejriwal},
journal= {arXiv preprint arXiv:2405.15185},
year = {2024}
}