PoF:用于改善泛化能力的特征提取器后训练
机器学习
2022-07-06 v1
摘要
已有大量研究指出,损失景观在极小值附近的局部形状(尤其是平坦度)对深度模型的泛化起着重要作用。我们开发了一种称为 PoF(特征提取器后训练)的训练算法,该算法更新已训练深度模型的特征提取器部分以搜索更平坦的极小值。其特点有两方面:1)基于表明应平坦化高层参数空间的观察,特征提取器在高层参数空间中的参数扰动下训练;2)扰动范围以数据驱动方式确定,旨在减少由正损失曲率引起的部分测试损失。我们提供了理论分析,表明所提算法隐式地减少了目标 Hessian 分量以及损失。实验结果表明,PoF 在 CIFAR-10 和 CIFAR-100 数据集上仅进行 10 轮后训练、在 SVHN 数据集上进行 50 轮后训练,均相对于基线方法提升了模型性能。源代码见:\url{https://github.com/DensoITLab/PoF-v1
引用
@article{arxiv.2207.01847,
title = {PoF: Post-Training of Feature Extractor for Improving Generalization},
author = {Ikuro Sato and Ryota Yamada and Masayuki Tanaka and Nakamasa Inoue and Rei Kawakami},
journal= {arXiv preprint arXiv:2207.01847},
year = {2022}
}
备注
Accepted to ICML2022. Contains a link to the code