从鲁棒性到预训练语言模型中泛化能力与校准的改进
计算与语言
2024-04-02 v1
摘要
增强预训练语言模型(PLM)的泛化能力和不确定性量化对于其有效性和可靠性至关重要。基于确立了鲁棒性对改善泛化能力重要性的机器学习研究,我们研究了通过 Jacobian 和 Hessian 正则化实现的表征平滑性在提升 PLM 性能中的作用。尽管此类正则化方法在计算机视觉中已被证明有效,但在自然语言处理(NLP)中,由于 PLM 的输入源自离散域,其应用带来了独特的挑战。我们引入了一种新颖的两阶段正则化方法 JacHess,该方法最小化 PLM 中间表征相对于其输入的 Jacobian 和 Hessian 矩阵的范数。我们使用 GLUE 基准进行的评估表明,JacHess 显著提高了 PLM 的域内泛化能力和校准,优于未正则化的微调及其他类似的正则化方法。
引用
@article{arxiv.2404.00758,
title = {From Robustness to Improved Generalization and Calibration in Pre-trained Language Models},
author = {Josip Jukić and Jan Šnajder},
journal= {arXiv preprint arXiv:2404.00758},
year = {2024}
}