使用无需访问任何训练或测试数据的泛化度量评估自然语言处理模型
计算与语言
2023-06-06 v3 机器学习
摘要
选择合适的架构参数和训练超参数对于提升机器学习(ML)模型性能至关重要。近期的若干实证研究对神经网络(NNs)开展大规模相关性分析,以寻找可指导此类模型选择的有效泛化度量(generalization metrics)。有效度量通常预期与测试性能强相关。在本文中,我们扩展先前的分析,通过以下目标考察基于泛化度量的模型选择:(i)聚焦自然语言处理(NLP)任务,因先前工作主要关注计算机视觉(CV)任务;(ii)考虑直接预测测试误差(test error)而非泛化差距(generalization gap)的度量;(iii)探索无需访问数据即可计算的度量。基于这些目标,我们首次给出了使用泛化度量对 Huggingface 上大型预训练 Transformer 的模型选择结果。我们的分析考虑(I)在不同设置下训练的数百个 Transformer,其中我们系统性地改变数据量、模型规模与优化超参数,(II)来自 Huggingface 八类 NLP 模型家族(包括 GPT2、BERT 等)的共 51 个预训练 Transformer,(III)共 28 个已有及新颖的泛化度量。尽管地位小众,我们发现源自重尾(HT)视角的度量在 NLP 任务中尤为有用,表现出强于其他更流行度量的相关性。为 further 考察这些度量,我们将先前依赖幂律(PL)谱分布的公式推广到指数(EXP)与指数截断幂律(E-TPL)族。
引用
@article{arxiv.2202.02842,
title = {Evaluating natural language processing models with generalization metrics that do not need access to any training or testing data},
author = {Yaoqing Yang and Ryan Theisen and Liam Hodgkinson and Joseph E. Gonzalez and Kannan Ramchandran and Charles H. Martin and Michael W. Mahoney},
journal= {arXiv preprint arXiv:2202.02842},
year = {2023}
}