中文

驾驭 LLM 潜在向量以检测幻觉

机器学习 2025-05-23 v2 人工智能 计算与语言

摘要

LLM 中的幻觉构成了在实际应用中安全部署的重大挑战。最近的研究方法利用 LLM 的潜在空间进行幻觉检测,但由于其嵌入向量是为语言连贯性而非事实准确性优化的,往往难以清晰区分真实内容与幻觉内容。为此,我们提出了真实性分离向量(TSV),这是一种轻量且灵活的驾驶向量,在推理过程中重塑 LLM 的表示空间,以增强真实输出与幻觉输出之间的分离度,同时不修改模型参数。我们的两阶段框架首先在小规模标记样本上训练 TSV,以形成紧凑且良好分离的簇。随后,利用基于最优传输的伪标签算法扩展样本集,并结合置信度过滤过程。大量实验表明,TSV 在最小标记数据下实现了最先进的性能,跨数据集具有强大的泛化能力,为实际应用中的 LLM 提供了实用解决方案。

关键词

引用

@article{arxiv.2503.01917,
  title  = {Steer LLM Latents for Hallucination Detection},
  author = {Seongheon Park and Xuefeng Du and Min-Hsuan Yeh and Haobo Wang and Yixuan Li},
  journal= {arXiv preprint arXiv:2503.01917},
  year   = {2025}
}

备注

ICML 2025