NoVo:利用注意力头范数投票消除大语言模型中的幻觉
计算与语言
2024-10-30 v2 人工智能
摘要
大型语言模型(LLM)中的幻觉仍是主要障碍,尤其在事实准确性至关重要的高风险应用中。虽然表示编辑和阅读方法在减少幻觉方面取得了进展,但其对特殊工具的强烈依赖以及针对特定领域样本的训练,使得其难以扩展且易产生过拟合。这限制了其准确度提升和对多样数据集的泛化能力。本文提出了一种轻量级方法——范数投票(NoVo),利用注意力头范数的潜在价值,显著提升零样图多选题(MCQs)中事实准确性。NoVo首先通过仅使用30个随机样本的高效推理-only算法自动选择与事实相关的头范数,使NoVo能够轻松扩展到多样数据集。随后,采用所选头范数执行简单的投票算法,显著提升预测准确度。在TruthfulQA MC1上,NoVo超过当前最先进方法和所有先前方法,提升了至少19个准确度点。NoVo在20个多样数据集上表现出卓越的泛化能力,在其中超过90%的数据集上实现显著提升,远超当前的所有表示编辑和阅读方法。NoVo还显示出对微调策略和构建文本对抗防御的潜在收益。NoVo对头范数的有效性开辟了LLM可解释性、鲁棒性和可靠性的新前沿。
引用
@article{arxiv.2410.08970,
title = {NoVo: Norm Voting off Hallucinations with Attention Heads in Large Language Models},
author = {Zheng Yi Ho and Siyuan Liang and Sen Zhang and Yibing Zhan and Dacheng Tao},
journal= {arXiv preprint arXiv:2410.08970},
year = {2024}
}