中文

波斯地毯:使用大尺度对称性求解叠加的 toy 模型

机器学习 2024-10-23 v2 无序系统与神经网络 人工智能

摘要

我们提供了对最小非线性稀疏数据自动编码器在大输入维数极限下所学习算法的完整机制描述。该模型原文见于 arXiv:2209.10652,通过线性层压缩稀疏数据向量,然后通过另一个线性层和 ReLU 激活函数进行解压。我们注意到,当数据具有排列对称性(即无输入特征被特权)时,大型模型可靠地学习到一种仅通过其大尺度统计量来敏感单个权重的算法。对于这些模型,损失函数变得可解析。借助这一理解,我们给出了在高稀疏性下损失的显式尺度,并表明该模型在最近提出的架构中是近乎最优的。特别是,无论是改变还是添加激活函数的任何元素级或滤波操作,最多只能以常数因子的方式改进该模型的性能。最后,我们人工构建了一个具有所需对称性的模型,证明其损失正好匹配训练模型的损失。与训练模型的权重不同,人工权重的低随机性导致类似波斯地毯的奇迹性分形结构出现,而该算法对此毫不在意。我们的工作通过引入理解自动编码器结构的技术,为神经网络可解释性做出了贡献。可在 https://github.com/KfirD/PersianRug 获取复现我们结果的代码。

关键词

引用

@article{arxiv.2410.12101,
  title  = {The Persian Rug: solving toy models of superposition using large-scale symmetries},
  author = {Aditya Cowsik and Kfir Dolev and Alex Infanger},
  journal= {arXiv preprint arXiv:2410.12101},
  year   = {2024}
}

备注

Improved arguments, presentation. No changes to results