通过最小 token 扰动探究 Transformer 的嵌入空间
机器学习
2025-06-24 v1 人工智能
机器学习
摘要
理解信息如何在 Transformer 模型中传播是可解释性的一个关键挑战。本文研究了对嵌入空间施加最小 token 扰动的效果。在实验中,我们分析了哪些 token 容易受到最小位移的影响,指出稀有 token 通常会导致更大的位移。此外,我们研究了扰动如何在不同层之间传播,表明输入信息在更深的层中越来越混合。我们的发现验证了常见假设,即模型的前几层可用作解释的代理。总体而言,本工作引入了将 token 扰动与嵌入空间位移相结合的技术,作为一种强大的模型可解释性工具。
引用
@article{arxiv.2506.18011,
title = {Probing the Embedding Space of Transformers via Minimal Token Perturbations},
author = {Eddie Conti and Alejandro Astruc and Alvaro Parafita and Axel Brando},
journal= {arXiv preprint arXiv:2506.18011},
year = {2025}
}
备注
IJCAI 2025 Workshop on Explainable Artificial Intelligence