在欺骗性指令下,真实表征会如何翻转?
人工智能
2025-10-30 v4 机器学习
摘要
大型语言模型(LLMs)倾向于遵循精心设计的恶意指令以生成欺骗性响应,这构成了安全挑战。然而,欺骗性指令如何改变LLM的内部表征相对于真实表征尚不清楚,已知研究仅限于输出分析。为弥合这一差距,我们研究了在欺骗性指令与真实/中性指令下,这些表征何时以及如何从真实翻转为欺骗。分析Llama-3.1-8B-Instruct和Gemma-2-9B-Instruct在事实验证任务上的内部表征,我们发现该模型的指令化True/False输出可通过线性探针在所有条件下基于内部表征被预测。进一步,我们使用稀疏自编码器(SAEs)表明,欺骗性指令导致显著的表征偏移,与真实/中性表征(彼此相似)形成对比,偏移集中在早至中层,并在复杂数据集上仍可被检测。我们还识别了特定SAE特征对欺骗指令高度敏感,并利用定向可视化确认了不同真实/欺骗表征子空间的差异。我们的分析在层级和特征水平确定了指令化不诚实的相关性,为LLM检测与控制提供了新见解。我们的发现揭示了欺骗行为的特征和层级特征,为检测和缓解LLM中的指令化不诚实行为提供了新视角。
引用
@article{arxiv.2507.22149,
title = {When Truthful Representations Flip Under Deceptive Instructions?},
author = {Xianxuan Long and Yao Fu and Runchao Li and Mu Sheng and Haotian Yu and Xiaotian Han and Pan Li},
journal= {arXiv preprint arXiv:2507.22149},
year = {2025}
}