内省适配器:训练 LLM 以报告其学习行为
人工智能
2026-04-29 v2
摘要
当模型开发者或用户对 LLM 进行微调时,这可能诱导出意外的、刻意有害的或难以检测的行为。如果 LLM 能简单地用自然语言描述其行为,将大大简化 LLM 的审计工作。在本研究中,我们探讨了一种可扩展的方法,以快速识别来自共享基础 LLM 的众多 LLM 的所学行为。给定模型 ,我们的方法通过对模型 进行微调以植入行为 ; 对作为标记训练数据。我们 then 对内省适配器(IA)进行训练:一个单一的 LoRA 适配器在所有微调的 上联合训练,以使其能够 verbalize 所植入的行为。我们发现,该 IA 即使对与 训练方式截然不同的从 中微调的模型也能诱导自我描述所学行为。例如,IA 能在 AuditBench 上实现最先进的识别显式隐藏有害行为能力。IA 还可用于检测加密微调 API 攻击。它们在模型规模和训练数据多样性方面表现出良好的可扩展性。总体而言,我们的结果表明,IA 是一种可扩展、有效且在实际中有用的审计微调 LLM 的方法。
引用
@article{arxiv.2604.16812,
title = {Introspection Adapters: Training LLMs to Report Their Learned Behaviors},
author = {Keshav Shenoy and Li Yang and Abhay Sheshadri and Sören Mindermann and Jack Lindsey and Sam Marks and Rowan Wang},
journal= {arXiv preprint arXiv:2604.16812},
year = {2026}
}