中文

零样本多任务幻觉检测

计算与语言 2024-03-20 v1

摘要

在近期的研究中,大语言模型的广泛使用凸显了用于评估文本生成质量及其与特定任务相关性的稳健评估方法的重要性。这揭示了一个被称为幻觉的普遍问题,即模型中生成文本对源内容缺乏忠实度并偏离评估标准的一种涌现状态。在本研究中,我们正式定义了幻觉,并基于我们的定义以及模型输出蕴含任务和样本特定输入的假设,提出了一个在零样本设置下对其进行定量检测的框架。在幻觉检测中,我们的解决方案在模型感知设置下达到了 0.78 的准确率,在模型无关设置下达到了 0.61 的准确率。值得注意的是,我们的解决方案保持了计算效率,所需的计算资源远少于其他最先进 (SOTA) 方法,符合向轻量化和压缩模型发展的趋势。

关键词

引用

@article{arxiv.2403.12244,
  title  = {Zero-Shot Multi-task Hallucination Detection},
  author = {Patanjali Bhamidipati and Advaith Malladi and Manish Shrivastava and Radhika Mamidi},
  journal= {arXiv preprint arXiv:2403.12244},
  year   = {2024}
}