ChatGPT提示工程无法估计高资源语言中的预测不确定性
计算与语言
2023-11-14 v1 机器学习
摘要
ChatGPT以其令人惊叹的能力席卷全球。由于其发布时无文档,科学家们立即试图通过其在自然语言处理(NLP)任务中的表现来界定其局限。本文旨在通过聚焦其在高资源语言中的表现,以及通过给出置信水平预测其答案准确性的能力,加入关于ChatGPT能力的日益增长文献。高资源语言的分析引人关注,因为研究表明低资源语言在NLP任务中表现劣于英语,但迄今尚无研究分析高资源语言是否与英语表现相当。对ChatGPT置信度校准的分析此前亦未开展,且对于了解ChatGPT的可信度至关重要。为研究这两方面,我们选取了五种高资源语言与两类NLP任务。要求ChatGPT以五种语言执行这两类任务,并为每个答案给出数值化置信值。结果显示,所有被选中的高资源语言表现相似,且ChatGPT不具备良好的置信度校准,常过度自信且从不给出低置信值。
引用
@article{arxiv.2311.06427,
title = {ChatGPT Prompting Cannot Estimate Predictive Uncertainty in High-Resource Languages},
author = {Martino Pelucchi and Matias Valdenegro-Toro},
journal= {arXiv preprint arXiv:2311.06427},
year = {2023}
}
备注
14 pages, 4 figures, with appendix