自动发现语言模型干预的意外副作用
计算与语言
2026-05-07 v1 人工智能
摘要
我们提出了一种用于审计语言模型干预行为影响的自动化、对比式评估流水线。给定基础模型 和干预模型 ,该方法比较其在对齐提示上下文下的自由形式、多标记生成,并生成人类可读的、经统计学验证的自然语言假设,描述两种模型之间的差异,同时归纳出总结经验证假设中常见主题的模式。我们在合成环境中评估该方法,通过注入已知行为变化并展示管道可靠地恢复这些变化。随后我们将其应用于三个真实世界的干预场景:蒙皮蒸馈、知识编辑和遗忘,结果显示该方法不仅揭示了意图行为变化和意外行为偏移,还能区分大幅和微小干预,以及在效果缺失或与提示库不一致时不会产生幻觉性差异。总体而言,该管道提供了一种在统计上有据可依且具可解释性的工具,用于事后审计干预导致的模型行为变化。
引用
@article{arxiv.2605.05090,
title = {Automatically Finding and Validating Unexpected Side-Effects of Interventions on Language Models},
author = {Quintin Pope and Ajay Hayagreeve Balaji and Jacques Thibodeau and Xiaoli Fern},
journal= {arXiv preprint arXiv:2605.05090},
year = {2026}
}
备注
33 pages, 4 figures, 20 tables, targeting EMNLP submission