中文

TruthX:通过在真实空间编辑大语言模型缓解幻觉

计算与语言 2024-06-06 v2 人工智能 机器学习

摘要

大语言模型 (LLMs) 有时会产生幻觉,尤其是 LLMs 可能在知晓正确知识的情况下仍生成不真实的回答。激活 LLM 内部的真实性是充分释放 LLM 知识潜力的关键。在本文中,我们提出了 TruthX,这是一种推理时干预方法,通过识别和编辑 LLM 内部表示中控制真实性的特征来激活 LLM 的真实性。TruthX 采用自编码器将 LLM 的表示分别映射到语义和真实潜在空间,并应用对比学习在真实空间内识别真实的编辑方向。在推理过程中,通过在真实空间中编辑 LLM 的内部表示,TruthX 有效地增强了 LLM 的真实性。实验表明,TruthX 在 TruthfulQA 基准测试上将 13 个先进 LLM 的真实性平均提高了 20%。进一步的分析表明,TruthX 可以通过仅编辑 LLM 内部表示中的一个向量来控制 LLM 生成真实或幻觉的回答。

关键词

引用

@article{arxiv.2402.17811,
  title  = {TruthX: Alleviating Hallucinations by Editing Large Language Models in Truthful Space},
  author = {Shaolei Zhang and Tian Yu and Yang Feng},
  journal= {arXiv preprint arXiv:2402.17811},
  year   = {2024}
}

备注

Accepted to ACL 2024 main conference, Project Page: https://ictnlp.github.io/TruthX-site/