BaRDa:一个区分事实准确性与推理能力的信念与推理数据集
计算与语言
2024-03-26 v2 人工智能
摘要
尽管存在众多比较现代语言模型(LM)性能的基准,但最终任务评估常常混淆了*事实准确性*(“真理”)和*推理能力*(“理性”,或正确报告信念含义意义上的“诚实”)的概念。我们的目标是构建一个清晰区分这两个概念的数据集。我们的方法是利用并扩展一组人工标注的*蕴含树*,这些树被设计用来表达好的和坏的推理链,并使用真假事实的混合,特别是包含反事实例子,以避免信念偏差(也称为“内容效应”)。由此产生的数据集名为BaRDa,包含3000个蕴含(1787个有效,1213个无效),使用了6681个真陈述和2319个假陈述。在四个GPT系列模型(GPT3(curie)/GPT3(davinici)/3.5/4)上进行测试,我们发现事实准确性(真理)得分为74.1/80.6/82.6/87.1,推理准确性得分为63.1/78.0/71.8/79.2。这显示了模型在提高事实准确性和蕴含推理方面的清晰进展,该数据集提供了一个新的基准,更清晰地区分和量化了这两个概念。
引用
@article{arxiv.2312.07527,
title = {BaRDa: A Belief and Reasoning Dataset that Separates Factual Accuracy and Reasoning Ability},
author = {Peter Clark and Bhavana Dalvi Mishra and Oyvind Tafjord},
journal= {arXiv preprint arXiv:2312.07527},
year = {2024}
}
备注
Added note about how dataset sampling was performed