中文

定位 Llama 中的说谎行为:通过提示、探测与修补理解真假命题上的受指令不诚实

机器学习 2023-11-28 v1 人工智能 计算与语言

摘要

大语言模型(LLMs)通过其输出展现出显著的知识,尽管通常不清楚错误的输出是由于缺乏知识还是不诚实所致。在本文中,我们研究受指令的不诚实行为,即我们显式地提示 LLaMA-2-70b-chat 说谎。我们进行提示工程以找到最能诱导说谎行为的提示,然后使用机制可解释性方法定位该行为在网络中的发生位置。利用线性探测(linear probing)与激活修补(activation patching),我们定位了五个对说谎尤为重要的层。进而我们在这些层中找到仅 46 个注意力头,使我们能够因果干预,使说谎的模型转而诚实作答。我们表明这些干预在许多提示与数据集划分上均稳健有效。总体而言,我们的工作增进了对 LLMs 中不诚实行为的理解,以期能够加以防范。

关键词

引用

@article{arxiv.2311.15131,
  title  = {Localizing Lying in Llama: Understanding Instructed Dishonesty on True-False Questions Through Prompting, Probing, and Patching},
  author = {James Campbell and Richard Ren and Phillip Guo},
  journal= {arXiv preprint arXiv:2311.15131},
  year   = {2023}
}

备注

14 pages, 12 figures