中文

基于最小描述长度原理的机器理解理论

机器学习 2025-06-11 v3 信息论 math.IT

摘要

过去十年,端到端学习训练的深度神经网络在多个领域取得了显著成就。然而,端到端学习策略原本是为以黑盒方式最小化预测损失而设计的,面临两个根本性局限:难以以自监督方式形成可解释的表征,以及无法严格遵循最小描述长度(MDL)原则进行信息压缩。这两个局限指向更深层次的问题:端到端学习模型无法“理解”它所学习的内容。本文建立了一个新理论,连接这两个局限。我们设计了Spectrum VAE,这是一个 novel 深度学习架构,其最小描述长度(MDL)可以严格评估。然后,我们引入潜在维度组合的概念,即我们称之为尖峰模式,并演示基于训练数据,为实现Spectrum VAE的MDL,观察到的尖峰模式应尽可能少。最终,我们的理论表明,当MDL针对给定数据分布达到时,Spectrum VAE会自然产生数据的可解释潜在表征。也就是说,可解释的表征——或“理解”——可以通过仅通过使深层网络遵循MDL原则的方式以自监督方式自然出现。在我们看来,这也意味着更深层的洞见:要理解就是要压缩。我们的理论的核心主张是深层网络的训练目标应发生变化:不仅要最小化预测损失,还要最小化关于给定数据的描述长度。也就是说,深层网络不仅要学习,还要理解它所学习的内容。本工作完全是理论性的,旨在激发基于MDL原则的自监督、可解释人工智能未来研究。

关键词

引用

@article{arxiv.2504.00395,
  title  = {A Theory of Machine Understanding via the Minimum Description Length Principle},
  author = {Canlin Zhang and Xiuwen Liu},
  journal= {arXiv preprint arXiv:2504.00395},
  year   = {2025}
}