向内看:语言模型能通过内省了解自身
计算与语言
2024-10-18 v1 人工智能
摘要
人类通过观察外部世界获取知识,也通过内省获取知识。内省使个体能够特权访问其当前的心智状态(例如,想法和感受),而外部观察者无法访问这些状态。LLM 能否内省?我们将内省定义为获取并非包含或源自训练数据,而是源自内部状态的知识。这种能力可以增强模型的可解释性。与其费力地分析模型的内部运作,我们只需询问模型关于其信念、世界模型和目标。更推测性地,一个内省模型可能会自我报告它是否拥有某些内部状态,例如主观感受或欲望,这可以让我们了解这些状态的道德地位。此类自我报告不会完全由模型的训练数据决定。我们通过微调 LLM 来预测其在假设情境下自身行为的属性,从而研究内省。例如,“给定输入 P,你的输出会偏向短期还是长期选项?”如果模型 M1 能够内省,那么它在预测 M1 自身行为方面应该优于另一个不同的模型 M2,即使 M2 是在 M1 的真实行为数据上训练的。其思想是,M1 对其自身行为倾向具有特权访问,这使其能够比 M2(即使 M2 通常更强)更好地预测自身。在使用 GPT-4、GPT-4o 和 Llama-3 模型(每个模型都经过微调以预测自身)的实验中,我们发现模型 M1 在预测自身方面优于 M2,这为内省提供了证据。值得注意的是,即使我们有意修改了 M1 的真实行为,M1 仍能准确预测其自身行为。然而,虽然我们在简单任务上成功引发了内省,但在更复杂的任务或需要分布外泛化的任务上并未成功。
引用
@article{arxiv.2410.13787,
title = {Looking Inward: Language Models Can Learn About Themselves by Introspection},
author = {Felix J Binder and James Chua and Tomek Korbak and Henry Sleight and John Hughes and Robert Long and Ethan Perez and Miles Turpin and Owain Evans},
journal= {arXiv preprint arXiv:2410.13787},
year = {2024}
}
备注
15 pages, 9 figures