非线性推理时干预:提升 LLM 真实性
计算与语言
2024-06-07 v2 机器学习
摘要
在本工作中,我们探索 LLM 的内部表示空间,以识别包含最真实和准确信息的注意力头。我们进一步开发了推理时干预(ITI)框架,该框架允许在无需微调的情况下对 LLM 施加偏置。这一改进体现在引入了非线性多 token 探测和多 token 干预:非线性 ITI(NL-ITI),它显著增强了在评估基准上的性能。NL-ITI 在包括 TruthfulQA 在内的多种多选数据集上进行了测试,我们报告称,相对于基线 ITI 结果,其 MC1(模型指向正确答案的准确率)相对提升超过 16%。此外,相较于近期发布的同样专注于改进 ITI 的 Truth Forest(TrFf)方法,我们取得了 10% 的相对提升。
引用
@article{arxiv.2403.18680,
title = {Non-Linear Inference Time Intervention: Improving LLM Truthfulness},
author = {Jakub Hoscilowicz and Adam Wiacek and Jan Chojnacki and Adam Cieslak and Leszek Michon and Vitalii Urbanevych and Artur Janicki},
journal= {arXiv preprint arXiv:2403.18680},
year = {2024}
}
备注
Accepted on Interspeech 2024 Conference. Code is available at https://github.com/Samsung/NL-ITI