中文

一种用于训练神经网络的微分熵估计器

机器学习 2022-06-22 v2 机器学习

摘要

互信息(MI)已被广泛用作训练神经网络的损失正则化项。在学习高维数据的解耦或压缩表示时,这尤其有效。然而,另一基本信息度量——微分熵(DE),尚未在神经网络训练中得到广泛应用。尽管 DE 比 MI 具有潜在更广泛的应用范围,但现有的现成 DE 估计器要么不可微、计算上难以处理,要么无法适应底层分布的变化。这些缺陷阻碍了它们作为正则化项用于神经网络训练。为解决先前提出的 DE 估计器的不足,本文我们引入 KNIFE,一种完全参数化、可微的基于核的 DE 估计器。我们方法的灵活性还允许我们构建基于 KNIFE 的条件(基于离散或连续变量)DE 以及 MI 估计器。我们在高维合成数据上实证验证了我们的方法,并进一步将其应用于指导真实世界任务的神经网络训练。我们在包括视觉域适应、文本公平分类和文本微调在内的多种任务上的实验证明了基于 KNIFE 的估计的有效性。代码可在 https://github.com/g-pichler/knife 找到。

关键词

引用

@article{arxiv.2202.06618,
  title  = {A Differential Entropy Estimator for Training Neural Networks},
  author = {Georg Pichler and Pierre Colombo and Malik Boudiaf and Günther Koliander and Pablo Piantanida},
  journal= {arXiv preprint arXiv:2202.06618},
  year   = {2022}
}

备注

to be presented at ICML2022 in Baltimore, MD