理解训练分布之外的经验交叉熵行为
机器学习
2019-05-29 v1 信息论
机器学习
math.IT
摘要
机器学习理论主要关注对与训练数据来自相同分布的样本的泛化。然而,为了实现更强大的泛化形式,更好地理解在观测分布发生变化时超越训练分布的泛化也具有根本的重要性。在本文中,我们试图通过信息论的视角,研究当样本的真实概率分布在训练和测试时可能不同的情况下,特定架构的行为。我们的主要结果是,经验交叉熵与其统计期望(相对于测试概率律测得)之间的测试间隙,可以以高概率被输入测试样本与训练时获得的编码器生成的相应表示之间的互信息所界定。这些理论性质的结果得到了数值模拟的支持,表明上述互信息代表了测试间隙,并在网络超参数方面定性地捕捉了其动态变化。
引用
@article{arxiv.1905.11972,
title = {Understanding the Behaviour of the Empirical Cross-Entropy Beyond the Training Distribution},
author = {Matias Vera and Pablo Piantanida and Leonardo Rey Vega},
journal= {arXiv preprint arXiv:1905.11972},
year = {2019}
}
备注
18 pages, 6 Figures