中文

神经表征的叠加解缠揭示隐藏对齐

机器学习 2025-11-14 v2

摘要

叠加假说指出,单个神经元可能参与表示多个特征,以便神经网络能够表示超过神经元数量的特征。在神经科学和人工智能领域,表征对齐度量用于衡量不同深度神经网络(DNN)或大脑是否表示类似信息。本文探讨了一个关键问题:叠加是否以任何不令人满意的方式与对齐度量相互作用?我们假设,那些以不同叠加安排表示相同特征的模型——即其神经元具有不同的特征线性组合——会干扰预测性映射度量(半匹配、软匹配、线性回归),导致其对齐程度低于预期。我们发展了一种关于置换度量如何依赖于叠加安排的理论。通过在玩具模型中训练稀疏自编码器(SAE)来解缠叠加,我们展示了当模型的基本神经元被其稀疏过完整潜在代码取代时,对齐得分通常会增加。在视觉领域,我们发现DNN-DNN和DNN大脑线性回归对齐也出现类似的增加。我们的结果表明,叠加解缠是映射度量发现神经网络之间真实表征对齐的必要条件。

关键词

引用

@article{arxiv.2510.03186,
  title  = {Superposition disentanglement of neural representations reveals hidden alignment},
  author = {André Longon and David Klindt and Meenakshi Khosla},
  journal= {arXiv preprint arXiv:2510.03186},
  year   = {2025}
}