SelfIE:大语言模型嵌入的自我解释
计算与语言
2024-03-27 v2 人工智能
机器学习
摘要
大语言模型(LLM)如何获得其答案?解释和控制 LLM 推理过程的能力是可靠性、透明性以及未来模型发展的关键。我们提出 SelfIE(Self-Interpretation of Embeddings,即嵌入的自我解释),是一个使 LLM 能够通过自然语言解释其自身嵌入的框架,利用其回答关于给定段落问题的能力。SelfIE 能够解释隐藏嵌入中的开放世界概念,在如做伦理决策、内化提示注入以及回忆有害知识等情境中揭示 LLM 的内部推理。SelfIE 对隐藏嵌入的文本描述也开辟了新的控制 LLM 推理途径。我们提出监督式控制(Supervised Control),允许仅需对单个层进行梯度计算即可编辑开放性概念。我们将 RLHF 扩展到隐藏嵌入上,提出强化控制(Reinforcement Control),可在无监督目标的情况下擦除 LLM 中的有害知识。
引用
@article{arxiv.2403.10949,
title = {SelfIE: Self-Interpretation of Large Language Model Embeddings},
author = {Haozhe Chen and Carl Vondrick and Chengzhi Mao},
journal= {arXiv preprint arXiv:2403.10949},
year = {2024}
}