中文

探索LLM真实方向在对话格式中的泛化能力

计算与语言 2025-05-16 v1 人工智能

摘要

若干近期工作认为,LLM具有一个通用的真实方向,使得真陈述与假陈述在模型的激活空间中是线性可分的。已有研究表明,在模型的单个隐藏状态上训练的线性探针可以在广泛的主题上泛化,甚至可用于LLM对话中的谎言检测。在本工作中,我们探索了这一真实方向在不同对话格式之间的泛化情况。我们发现,在以谎言结尾的短对话中泛化效果良好,但在谎言出现在输入提示较前位置的长格式中泛化效果较差。我们提出了一种通过在每段对话末尾添加固定关键短语来显著改善此类泛化的解决方案。我们的结果揭示了实现能够泛化到新场景的可靠LLM谎言检测器所面临的挑战。

关键词

引用

@article{arxiv.2505.09807,
  title  = {Exploring the generalization of LLM truth directions on conversational formats},
  author = {Timour Ichmoukhamedov and David Martens},
  journal= {arXiv preprint arXiv:2505.09807},
  year   = {2025}
}