中文

SAFE:基于稀疏自编码器的 LLM 查询丰富与幻觉缓解框架

计算与语言 2025-03-06 v1

摘要

尽管大型语言模型(LLM)在各方面表现卓越,但这些模型常常会产生幻觉,可能削弱其在关键应用中的性能。本文提出SAFE方法,通过利用稀疏自编码器(SAE)检测并缓解幻觉问题。虽然幻觉检测技术和SAE各自被探索,但其在综合系统中的协同应用,特别是针对幻觉感知查询丰富,尚未得到充分探讨。为验证SAFE的有效性,我们在三个跨领域数据集上评估了其对两个配备SAE的模型。经验结果表明,SAFE在所有数据集上均能持续提高查询生成准确率并缓解幻觉,最高可实现准确率提升29.45%。

关键词

引用

@article{arxiv.2503.03032,
  title  = {SAFE: A Sparse Autoencoder-Based Framework for Robust Query Enrichment and Hallucination Mitigation in LLMs},
  author = {Samir Abdaljalil and Filippo Pallucchini and Andrea Seveso and Hasan Kurban and Fabio Mercorio and Erchin Serpedin},
  journal= {arXiv preprint arXiv:2503.03032},
  year   = {2025}
}