中文

观点:以经验依据的可辨识理论将加速自监督学习研究

机器学习 2025-07-25 v3 人工智能 机器学习

摘要

自监督学习 (SSL) 为当前许多人工智能系统提供动力。随着研究兴趣和投资的增长,SSL 的设计空间持续扩张。遵循柏拉图式表示假设 (PRH) 的 SSL 的柏拉图式观点表明,尽管不同的方法和工程方法存在差异,所有表示都趋向于相同的柏拉图式理想。然而,这一现象缺乏精确的理论解释。通过综合可辨识理论 (IT) 的证据,我们展示 PRH 可在 SSL 中出现。然而,当前的 IT 无法解释 SSL 的实证成功。为弥合理论与实践之间的差距,我们提出将 IT 扩展为我们称之为“单一可辨识理论” (SITh) 的更广泛理论框架,涵盖整个 SSL 管道。SITh 将使我们能够深入了解 SSL 中隐含的数据假设,推动领域向学习更可解释和更通用表示的方向发展。我们指出三个关键的未来研究方向:1)SSL 的训练动力学和收敛性质;2)有限样本、批量大小和数据多样性的影响;3)架构、数据增强、初始化方案和优化器中归纳偏置的作用。

关键词

引用

@article{arxiv.2504.13101,
  title  = {Position: An Empirically Grounded Identifiability Theory Will Accelerate Self-Supervised Learning Research},
  author = {Patrik Reizinger and Randall Balestriero and David Klindt and Wieland Brendel},
  journal= {arXiv preprint arXiv:2504.13101},
  year   = {2025}
}

备注

ICML2025 camera ready