ClimateX:LLM 能否准确评估人类对气候陈述的专家置信度?
机器学习
2023-11-30 v1 人工智能
计算与语言
计算机与社会
信息检索
摘要
在气候科学与政策领域,评估大语言模型(LLM)生成输出的准确性尤为重要。我们引入了气候陈述专家置信度(ClimateX)数据集,这是一个新颖的、经过筛选的、由专家标注的数据集,包含从最新的政府间气候变化专门委员会(IPCC)报告中收集的 8094 条气候陈述,并标注了相应的置信度水平。使用该数据集,我们表明近期的 LLM 能够对气候相关陈述中的人类专家置信度进行分类,尤其是在少样本学习设定下,但准确率有限(最高达 47%)。总体而言,模型在低和中等置信度陈述上表现出持续且显著的过度自信。我们强调了我们的结果对气候传播、LLM 评估策略以及 LLM 在信息检索系统中使用的影响。
引用
@article{arxiv.2311.17107,
title = {ClimateX: Do LLMs Accurately Assess Human Expert Confidence in Climate Statements?},
author = {Romain Lacombe and Kerrie Wu and Eddie Dilworth},
journal= {arXiv preprint arXiv:2311.17107},
year = {2023}
}
备注
Tackling Climate Change with Machine Learning workshop at NeurIPS 2023