中文

基于 Rényi 散度的深度互学习

机器学习 2024-09-19 v7 人工智能

摘要

本文重新审视深度互学习(DML)这一简单而有效的计算范式。我们提出使用 Rényi 散度替代 KL 散度,前者更灵活且可调,以改进原始 DML。该修改能以有限的额外复杂度持续优于原始 DML。我们从理论上分析了所提范式的收敛性质,并证明在非负凸优化任务的最坏情况下,采用恒定学习率的随机梯度下降(SGD)以 O(1) 偏差收敛。即学习会到达局部最优附近但继续在有限范围内搜索,这可能有助于缓解过拟合。最后,我们广泛的实证结果表明,将 DML 与 Rényi 散度结合具有优势,可进一步改善模型泛化能力。

关键词

引用

@article{arxiv.2209.05732,
  title  = {R\'{e}nyi Divergence Deep Mutual Learning},
  author = {Weipeng Huang and Junjie Tao and Changbo Deng and Ming Fan and Wenqiang Wan and Qi Xiong and Guangyuan Piao},
  journal= {arXiv preprint arXiv:2209.05732},
  year   = {2024}
}