双线性MLP中通过架构归纳偏置实现的结构解耦
机器学习
2026-02-06 v1
摘要
即使在任务具有底层代数结构的情况下,选择性遗忘和长程外推在现代神经网络中仍然脆弱。在这项工作中,我们认为这些失败不仅仅源于优化或遗忘算法,还源于模型在训练过程中构建其内部表示的方式。我们探索了将显式乘法交互作为架构归纳偏置是否有助于结构解耦,具体通过双线性MLP实现。我们分析表明,双线性参数化在梯度流条件下具有“非混合”性质,其中功能组件分离成正交子空间表示。这为外科手术式的模型修改提供了数学基础。我们通过一系列受控实验验证了这一假设,这些实验涵盖模算术、循环推理、李群动力学和针对性遗忘基准。与逐点非线性网络不同,乘法架构能够恢复与底层代数结构对齐的真实算子。我们的结果表明,模型的可编辑性和泛化性受到表示结构的约束,并且架构归纳偏置在实现可靠遗忘中起着核心作用。
引用
@article{arxiv.2602.05635,
title = {Structural Disentanglement in Bilinear MLPs via Architectural Inductive Bias},
author = {Ojasva Nema and Kaustubh Sharma and Aditya Chauhan and Parikshit Pareek},
journal= {arXiv preprint arXiv:2602.05635},
year = {2026}
}