中文

大语言模型的自相矛盾幻觉:评估、检测与缓解

计算与语言 2024-03-19 v3 人工智能 机器学习

摘要

大语言模型(large LMs)容易产生包含幻觉内容的文本。该问题的一个重要实例是自相矛盾,即 LM 在同一上下文中生成两个相互矛盾的句子。在这项工作中,我们对多种指令微调 LM 的自相矛盾进行了涵盖评估、检测和缓解的全面研究。我们的主要评估任务是开放域文本生成,但我们也展示了我们的方法在较短问答上的适用性。我们的分析揭示了自相矛盾的普遍性,例如 ChatGPT 生成的所有句子中有 17.7% 存在此问题。我们随后提出了一种新颖的基于提示的框架,旨在有效检测和缓解自相矛盾。我们的检测器实现了高准确率,例如提示 ChatGPT 时约 80% 的 F1 分数。该缓解算法迭代地精炼生成的文本,以去除矛盾信息,同时保持文本流畅性与信息性。重要的是,我们的整个框架适用于黑盒 LM,且不需要检索外部知识。相反,我们的方法补充了基于检索的方法,因为大部分自相矛盾(例如 ChatGPT 的 35.2%)无法使用在线文本验证。我们的方法在实践中有效,并已作为一键工具发布以惠及公众,见 https://chatprotect.ai/。

关键词

引用

@article{arxiv.2305.15852,
  title  = {Self-contradictory Hallucinations of Large Language Models: Evaluation, Detection and Mitigation},
  author = {Niels Mündler and Jingxuan He and Slobodan Jenko and Martin Vechev},
  journal= {arXiv preprint arXiv:2305.15852},
  year   = {2024}
}