对齐探测:关联有毒行为与模型内部表征
计算与语言
2025-09-25 v2
摘要
我们提出对齐探测(aligned probing),这是一种新颖的可解释性框架,用于将语言模型(LM)的行为(基于其输出)与其内部表征(internals)进行对齐。在此框架下,我们检查了超过20个 OLMo、Llama 和 Mistral 模型,首次在毒性语境下桥接行为与内部视角。我们的结果表明,语言模型强烈地编码关于输入及后续输出毒性程度的信息,尤其在较低的层次中。我们聚焦于如何独特的语言模型不同,提供了相关性和因果性证据,表明它们在强编码输入毒性信息时,生成更少的有毒输出。我们还强调了毒性的异质性,由于模型行为和内部表征在诸如威胁等独特属性上会有所不同。最后,四个案例研究分析了去毒化、多提示评估、模型量化和预训练动力学,凸显了对齐探测在实际中的影响,并提供了具体的见解。我们的发现有助于更全面地理解语言模型,既在毒性语境内,也在更广泛的语境中。
引用
@article{arxiv.2503.13390,
title = {Aligned Probing: Relating Toxic Behavior and Model Internals},
author = {Andreas Waldis and Vagrant Gautam and Anne Lauscher and Dietrich Klakow and Iryna Gurevych},
journal= {arXiv preprint arXiv:2503.13390},
year = {2025}
}