定位 Llama 中的说谎行为:通过提示、探测与修补理解真假命题上的受指令不诚实
机器学习
2023-11-28 v1 人工智能
计算与语言
摘要
大语言模型(LLMs)通过其输出展现出显著的知识,尽管通常不清楚错误的输出是由于缺乏知识还是不诚实所致。在本文中,我们研究受指令的不诚实行为,即我们显式地提示 LLaMA-2-70b-chat 说谎。我们进行提示工程以找到最能诱导说谎行为的提示,然后使用机制可解释性方法定位该行为在网络中的发生位置。利用线性探测(linear probing)与激活修补(activation patching),我们定位了五个对说谎尤为重要的层。进而我们在这些层中找到仅 46 个注意力头,使我们能够因果干预,使说谎的模型转而诚实作答。我们表明这些干预在许多提示与数据集划分上均稳健有效。总体而言,我们的工作增进了对 LLMs 中不诚实行为的理解,以期能够加以防范。
引用
@article{arxiv.2311.15131,
title = {Localizing Lying in Llama: Understanding Instructed Dishonesty on True-False Questions Through Prompting, Probing, and Patching},
author = {James Campbell and Richard Ren and Phillip Guo},
journal= {arXiv preprint arXiv:2311.15131},
year = {2023}
}
备注
14 pages, 12 figures