面向自由文本生成的令牌级无参考幻觉检测基准
计算与语言
2022-04-05 v2 人工智能
摘要
像 GPT-3 这样的大型预训练生成模型常常会产生虚构不存在或不正确内容的幻觉,这削弱了它们在实际应用中的潜在价值。现有工作通常试图在句子或文档层面基于相应的真实参考来检测这些幻觉。然而,对于许多自由文本生成应用,真实参考可能并不容易获得,且句子或文档层面的检测可能无法提供可在实时中防止错误内容的细粒度信号。作为解决这些问题的第一步,我们提出了一种新颖的令牌级、无参考的幻觉检测任务以及一个名为 HaDes(HAllucination DEtection dataSet,幻觉检测数据集)的关联标注数据集。为创建该数据集,我们首先扰动从英文维基百科中提取的大量文本片段,随后通过众包标注进行核验。为缓解标注过程中的标签不平衡,我们采用了一种迭代的模型在环策略。我们进行了全面的数据分析并构建了多个基线模型。
引用
@article{arxiv.2104.08704,
title = {A Token-level Reference-free Hallucination Detection Benchmark for Free-form Text Generation},
author = {Tianyu Liu and Yizhe Zhang and Chris Brockett and Yi Mao and Zhifang Sui and Weizhu Chen and Bill Dolan},
journal= {arXiv preprint arXiv:2104.08704},
year = {2022}
}
备注
Accepted by ACL2022 main conference