表示学习中的谱幽灵:从成分分析到自监督学习
机器学习
2026-02-16 v2
摘要
自监督学习(SSL)通过释放无标签数据的力量在实际应用中取得了显著的性能提升。具体而言,SSL从大规模无标签数据中提取表示,并将其传递到数据有限的众多下游任务中。表示学习在 diverse applications 上的显著性能提升吸引了日益关注的结果是各种截然不同的自监督学习目标用于表示提取,涌现出多种学习程序,但缺乏清晰而统一的理解。这种缺乏阻碍了表示学习的持续发展,使其缺乏理论依据,算法设计的原则不清晰,而在实际中使用表示学习方法缺乏合理性。统一框架的紧迫性进一步由于表示学习方法的快速增长。因此,我们被迫为表示学习构建一个原则性的基础。我们首先从谱表示视角理论地考察表示的充分性,这揭示了现有成功SSL算法的谱本质,为理解和分析提供了统一框架。这种框架还激发了开发更高效、易于使用的表示学习算法的动力,这些算法在现实应用中以原则方式实现。
引用
@article{arxiv.2601.20154,
title = {Spectral Ghost in Representation Learning: from Component Analysis to Self-Supervised Learning},
author = {Bo Dai and Na Li and Dale Schuurmans},
journal= {arXiv preprint arXiv:2601.20154},
year = {2026}
}
备注
43 pages, 3 figures