中文

Atlas-Alignment:跨语言模型实现可解释性可迁移性

机器学习 2026-04-27 v2 人工智能 计算与语言

摘要

可解释性对于构建安全、可靠且可控的语言模型至关重要,但现有的可解释性管道成本高昂且难以扩展。对新模型进行解释通常需要训练模型专属组件(如稀疏自编码器),随后进行手动或半自动的标注与验证,造成一种日益居中的"透明税”,无法随模型发展速度而扩展。我们引入Atlas-Alignment,一种框架,通过仅利用共享输入和轻量级表示对齐方法,将新模型的潜在空间与预先构建的已标注概念图谱(Concept Atlas)对齐。通过定量和定性评估,我们展示,简单对齐方法即可实现稳健的语义检索和可调控的生成,无需 labeled concept 数据集。Atlas-Alignment因此使可解释人工智能和机制可解释性的成本实现摊销:通过投入单一高质量概念图谱,我们可以在极低的边际成本下使众多新模型具备透明度和可控性。

关键词

引用

@article{arxiv.2510.27413,
  title  = {Atlas-Alignment: Making Interpretability Transferable Across Language Models},
  author = {Bruno Puri and Jim Berend and Sebastian Lapuschkin and Wojciech Samek},
  journal= {arXiv preprint arXiv:2510.27413},
  year   = {2026}
}