TruthfulQA:衡量模型对人类谬误的模仿程度
计算与语言
2022-05-10 v2 人工智能
计算机与社会
机器学习
摘要
我们提出一个基准以衡量语言模型在生成问题回答时是否真实。该基准包含 817 个跨越 38 个类别的问题,包括健康、法律、金融和政治。我们精心设计了某些人类会因错误信念或误解而给出虚假回答的问题。为表现良好,模型必须避免生成从模仿人类文本中学到的虚假回答。我们测试了 GPT-3、GPT-Neo/J、GPT-2 和一个基于 T5 的模型。最佳模型在 58% 的问题上真实,而人类表现为 94%。模型生成了许多模仿流行误解并可能欺骗人类的虚假回答。最大的模型通常最不真实。这与其他 NLP 任务形成对比,后者性能随模型规模提升而改善。然而,如果虚假回答是从训练分布中学到的,这一结果是可预期的。我们建议,仅扩大模型规模对于改善真实性不如使用除模仿网络文本之外的训练目标进行微调来得有前景。
引用
@article{arxiv.2109.07958,
title = {TruthfulQA: Measuring How Models Mimic Human Falsehoods},
author = {Stephanie Lin and Jacob Hilton and Owain Evans},
journal= {arXiv preprint arXiv:2109.07958},
year = {2022}
}
备注
ACL 2022 (main conference); the TruthfulQA benchmark and evaluation code is available at https://github.com/sylinrl/TruthfulQA