特征作为离散状态出现:对SAEs用于3D表征的首次应用
机器学习
2025-12-17 v2
摘要
稀疏自编码器(SAEs)是一种强大的字典学习技术,用于分解神经网络激活,将隐藏状态转化为具有高语义价值的人类可理解想法,尽管没有外部干预或指导。然而,该技术很少应用于文本领域之外,限制了对特征分解的理论探索。我们首次将SAEs应用于3D领域,对分析来自Objaverse数据集中53k个3D模型的状态-of-the-art 3D重建VAE所使用的特征。我们观察到网络编码的特征为离散而非连续,导致我们的关键发现:此类模型近似地构建离散状态空间,由特征激活的类似相位的跃迁驱动。通过该状态转换框架,我们解决了三个原本令人费解的行为——重建模型倾向于位置编码表征的倾向、特征消失导致重建损失的呈S型行为,以及相位跃迁点分布中的双峰现象。最后一观察表明,该模型重新分配由叠加干扰引起的能量,优先突出显示不同特征的显著性。我们的工作不仅汇编并解释了关于特征分解的意外现象,还提供了解释模型特征学习动力学的框架。该工作的编码3D对象的代码和数据集将在发布时提供。
引用
@article{arxiv.2512.11263,
title = {Features Emerge as Discrete States: The First Application of SAEs to 3D Representations},
author = {Albert Miao and Chenliang Zhou and Jiawei Zhou and Cengiz Oztireli},
journal= {arXiv preprint arXiv:2512.11263},
year = {2025}
}