互信息学习回归器:训练回归系统的信息论视角
机器学习
2022-11-24 v1 信息论
机器学习
math.IT
最优化与控制
摘要
作为机器学习中的核心任务之一,回归在诸多领域有着广泛应用。现有解决回归问题的常见做法是均方误差(MSE)最小化方法或其正则化变体,这些方法需要关于模型的先验知识。近来,Yi等人提出了一种基于互信息的监督学习框架,其中引入了无需任何先验知识的标签熵正则化。当应用于分类任务并通过随机梯度下降(SGD)优化算法求解时,该方法相较常用的交叉熵损失及其变体取得了显著提升。然而,他们未对所提公式的SGD算法给出理论收敛性分析。此外,由于标签的支撑集可能无穷,将该框架应用于回归任务并非易事。本文在基于互信息的监督学习框架下研究回归问题。我们首先论证MSE最小化方法等价于一个条件熵学习问题,进而利用重参数化技术提出一种用于求解回归问题的互信息学习公式。针对所提公式,我们给出了实践中用SGD算法求解的收敛性分析。最后,我们考虑一个多输出回归数据模型,推导了关于底层数据分布互信息的泛化性能下界。结果表明,高维可能是一种福音而非诅咒,这由某一阈值控制。我们希望本工作能作为基于互信息的回归进一步研究的良好起点。
引用
@article{arxiv.2211.12685,
title = {Mutual Information Learned Regressor: an Information-theoretic Viewpoint of Training Regression Systems},
author = {Jirong Yi and Qiaosheng Zhang and Zhen Chen and Qiao Liu and Wei Shao and Yusen He and Yaohua Wang},
journal= {arXiv preprint arXiv:2211.12685},
year = {2022}
}
备注
28 pages, 2 figures, presubmitted to AISTATS2023 for reviewing