nnterp:面向 Transformer 可解释性的标准化接口
机器学习
2025-12-16 v2 人工智能
摘要
可解释性研究需要可靠的工具来跨不同架构分析 Transformer 的内部结构。当前方法面临根本性的权衡:定制实现如 TransformerLens 确保一致的接口,但需要为每个架构手动编写适配代码,导致与原始模型之间存在数值不匹配;而通过 NNsight 直接访问 HuggingFace 则保留了精确行为,但缺乏跨模型的标准化。为弥合这一鸿沟,我们开发 nnterp,这是一个轻量级的 NNsight 包装器,提供面向 Transformer 分析的统一接口,同时保留原始 HuggingFace 实现。通过自动模块重命名和全面验证测试,nnterp 使研究人员能够编写一次干预代码,并在 50 多个模型变体(覆盖 16 个架构家族)上部署。该库包含常见可解释性方法(logit lens、patchscope、activation steering)的内置实现,并提供对支持其注意力概率的模型的直接访问。通过随库打包验证测试,研究人员可在本地验证与自定义模型的兼容性。nnterp 在可解释性工具的正确性和可用性之间架起了桥梁。
关键词
引用
@article{arxiv.2511.14465,
title = {nnterp: A Standardized Interface for Mechanistic Interpretability of Transformers},
author = {Clément Dumas},
journal= {arXiv preprint arXiv:2511.14465},
year = {2025}
}
备注
7 pages, 1 figure, accepted at the mechanistic interpretability workshop of NeurIPS 2025