可解释位置编码的学习取决于初始化
机器学习
2025-06-24 v4
摘要
在变换器中,位置编码(PE)提供了区分序列中各标记位置与顺序的关键信息。大多数关于PE对泛化影响的先前研究针对的是1维输入序列,如自然语言文本,其中相邻标记(如单词)高度相关。相比之下,许多实际任务涉及高度非平凡的位置安排的数据集,如多维空间组织的数据集,或位置信息未知的数据集。本文发现,位置编码初始化方式的选择极大地影响其学习可解释PE的能力,从而提升泛化性能。我们在三个实验中进行经验验证:1)2维关系推理任务;2)非线性随机网络仿真;3)真实世界的3维神经科学数据集。通过可解释性分析验证了准确PE学习的结果。总体而言,我们发现,通过小范数分布初始化的可学习PE能够:1)揭示在多维空间中镜像真实位置的可解释PE,以及2)实现改进的泛化。这些结果说明了学习可识别且可解释PE以提升泛化性能的可行性。
引用
@article{arxiv.2406.08272,
title = {Learning interpretable positional encodings in transformers depends on initialization},
author = {Takuya Ito and Luca Cocchi and Tim Klinger and Parikshit Ram and Murray Campbell and Luke Hearne},
journal= {arXiv preprint arXiv:2406.08272},
year = {2025}
}
备注
ICML 2025, Workshop on Actionable Interpretability