玩具组合可解释性模型揭示早期特征空间中的彩票票据
机器学习
2026-05-19 v1
摘要
彩票票据假设认为,稠密网络中包含稀疏子网络——“获胜票据”——这些子网络在被重绕到初始权重并以孤立方式重新训练后,能匹配完整模型的性能。我们提出更机制化的问题:获胜票据保存的内部对象是什么?我们工作于一个组合结构的玩具环境中,该环境采用可解释特征空间表示,并在特征之间定义明确的组合距离。我们展示,权空间中的获胜票据对应于特征空间中已接近最终特征通道代码的前导位置。在初始化时,这些位置就已经接近。稠密 SGD 通过结构化选择解决这些位置:接近的位置要么收敛到最终代码,要么被拒绝,拒绝集中在更拥挤的神经元上,暗示在叠加状态下的竞争。因此,获胜票据是一族在接近最终代码与低特征间干扰之间进行兼容平衡的代码位置。稀疏再训练通常会在不同行上重新表达相同的子句/模板族,因此被保存的对象是族级的,而非微观的行身份。在本环境中,我们基于特征空间距离和运动的轻量探针来验证此解释;这些探针在准确率和精确代码恢复方面常常优于 established 的基于权重的票据发现方法。虽然这些发现建立在玩具环境中,但它们表明彩票结构由隐藏特征空间几何而非权空间子网络身份所支配。
引用
@article{arxiv.2605.17704,
title = {Toy Combinatorial Interpretability Models Reveal Lottery Tickets in Early Feature Space},
author = {Alon Bebchuk and Nir Shavit},
journal= {arXiv preprint arXiv:2605.17704},
year = {2026}
}