基于 Rényi 散度的深度互学习
机器学习
2024-09-19 v7 人工智能
摘要
本文重新审视深度互学习(DML)这一简单而有效的计算范式。我们提出使用 Rényi 散度替代 KL 散度,前者更灵活且可调,以改进原始 DML。该修改能以有限的额外复杂度持续优于原始 DML。我们从理论上分析了所提范式的收敛性质,并证明在非负凸优化任务的最坏情况下,采用恒定学习率的随机梯度下降(SGD)以 O(1) 偏差收敛。即学习会到达局部最优附近但继续在有限范围内搜索,这可能有助于缓解过拟合。最后,我们广泛的实证结果表明,将 DML 与 Rényi 散度结合具有优势,可进一步改善模型泛化能力。
引用
@article{arxiv.2209.05732,
title = {R\'{e}nyi Divergence Deep Mutual Learning},
author = {Weipeng Huang and Junjie Tao and Changbo Deng and Ming Fan and Wenqiang Wan and Qi Xiong and Guangyuan Piao},
journal= {arXiv preprint arXiv:2209.05732},
year = {2024}
}