推理时干预:从语言模型中引出真实回答
机器学习
2024-06-27 v6 人工智能
计算与语言
摘要
我们提出推理时干预(Inference-Time Intervention, ITI),一种旨在增强大语言模型(LLM)「真实性」的技术。ITI 通过在推理过程中沿一组方向偏移有限数量注意力头上的模型激活来运作。该干预显著提升了 LLaMA 模型在 TruthfulQA 基准上的表现。在一个名为 Alpaca 的指令微调 LLaMA 上,ITI 将其真实性从 32.5% 提升至 65.1%。我们发现了真实性与有用性之间的权衡,并展示了如何通过调节干预强度来平衡二者。ITI 侵入性极小且计算开销低。此外,该技术数据高效:尽管 RLHF 等方法需要大量标注,ITI 仅使用数百个样本即可定位真实方向。我们的发现表明,LLM 可能具有对事物为真之可能性的内部表征,即便它们在表面生成虚假内容。
引用
@article{arxiv.2306.03341,
title = {Inference-Time Intervention: Eliciting Truthful Answers from a Language Model},
author = {Kenneth Li and Oam Patel and Fernanda Viégas and Hanspeter Pfister and Martin Wattenberg},
journal= {arXiv preprint arXiv:2306.03341},
year = {2024}
}
备注
NeurIPS 2023 spotlight; code: https://github.com/likenneth/honest_llama