中文

自动发现语言模型干预的意外副作用

计算与语言 2026-05-07 v1 人工智能

摘要

我们提出了一种用于审计语言模型干预行为影响的自动化、对比式评估流水线。给定基础模型 M1M_1 和干预模型 M2M_2,该方法比较其在对齐提示上下文下的自由形式、多标记生成,并生成人类可读的、经统计学验证的自然语言假设,描述两种模型之间的差异,同时归纳出总结经验证假设中常见主题的模式。我们在合成环境中评估该方法,通过注入已知行为变化并展示管道可靠地恢复这些变化。随后我们将其应用于三个真实世界的干预场景:蒙皮蒸馈、知识编辑和遗忘,结果显示该方法不仅揭示了意图行为变化和意外行为偏移,还能区分大幅和微小干预,以及在效果缺失或与提示库不一致时不会产生幻觉性差异。总体而言,该管道提供了一种在统计上有据可依且具可解释性的工具,用于事后审计干预导致的模型行为变化。

关键词

引用

@article{arxiv.2605.05090,
  title  = {Automatically Finding and Validating Unexpected Side-Effects of Interventions on Language Models},
  author = {Quintin Pope and Ajay Hayagreeve Balaji and Jacques Thibodeau and Xiaoli Fern},
  journal= {arXiv preprint arXiv:2605.05090},
  year   = {2026}
}

备注

33 pages, 4 figures, 20 tables, targeting EMNLP submission