中文

从信息论视角理解机器学习中的编码器-解码器结构

机器学习 2024-06-03 v1 信息论 math.IT 机器学习

摘要

我们提出了新的结果,用于从信息论角度建模和理解机器学习 (ML) 中编码器-解码器设计的作用。我们使用两种主要信息概念,即信息充分性 (information sufficiency, IS) 和相互信息损失 (mutual information loss, MIL),来表示机器学习中的预测结构。我们的第一个主要结果提供了一个功能表达式, characterize 与 IS 编码器-解码器潜在预测结构相符的概率模型类别。该结果正式合理化了许多现代 ML 架构采用的编码器-解码器前向阶段,用于学习分类的潜在 (压缩) 表示。为说明 IS 作为现实且相关的模型假设,我们重访一些已知的 ML 概念,呈现一些有趣的新示例:不变模型、稳健模型、稀疏模型和数字模型。此外,我们的 IS 描述允许我们解决一个根本问题:在给定编码器-解码器架构被采用于学习设置时,可能会损失多少性能 (预测表达性),使用交叉熵风险。此处,我们的第二个主要结果显示,相互信息损失量化了由于选择 (偏置) 编码器-解码器 ML 设计而导致的表达性不足。最后,我们解决了使用编码器-解码器设计进行通用交叉熵学习的问题,其中建立了必要性和充分性条件以满足这一要求。在所有这些结果中,香浓的信息度量为表示学习提供了新的解释和解释。

关键词

引用

@article{arxiv.2405.20452,
  title  = {Understanding Encoder-Decoder Structures in Machine Learning Using Information Measures},
  author = {Jorge F. Silva and Victor Faraggi and Camilo Ramirez and Alvaro Egana and Eduardo Pavez},
  journal= {arXiv preprint arXiv:2405.20452},
  year   = {2024}
}