通过消除对称性控制模型表达性并提高优化
机器学习
2025-07-01 v4 人工智能
机器学习
摘要
当损失函数中存在对称性时,模型很可能陷入一种称为“崩溃”的低容量状态。陷入这些低容量状态是许多深度学习应用场景中训练的主要障碍。我们首先证明了对称性通过两种具体机制导致训练和推理期间容量降低和被忽视的特征。随后,我们提出一种简单且在理论上得到论证的算法,syre,用于消除神经网络中几乎所有由对称性引起的低容量状态。当这种类型的陷阱尤为成问题时,使用所提方法消除对称性与改进的优化或性能密切相关。值得注意的是,所提方法具有 remarkable 的一点是它是模型无关的,不需要对对称性的任何知识。
引用
@article{arxiv.2408.15495,
title = {Remove Symmetries to Control Model Expressivity and Improve Optimization},
author = {Liu Ziyin and Yizhou Xu and Isaac Chuang},
journal= {arXiv preprint arXiv:2408.15495},
year = {2025}
}
备注
preprint