中文

NeurIPS 2023大型语言模型效率微调竞赛分析

机器学习 2025-03-19 v1 机器学习

摘要

我们对NeurIPS 2023大型语言模型(LLM)微调竞赛的分析结果揭示了以下趋势:获胜模型在基准数据集上表现出显著的过拟合,反映了当前基准评估中存在的普遍性过拟合问题,数据 curated(数据整理)是获得高性能LLM的关键。该竞赛包含两个阶段——公开评估阶段使用公开任务,封闭评估阶段使用不可见任务——使我们能够评估微调后LLM的泛化能力。我们的结果凸显了当前基于基准测试的生成式模型评估方法的局限性,并展示了需要更稳健的评估方法。值得注意的是,获胜提交方案采用了标准开源库,主要关注数据整理。为促进进一步的研究并提高可重复性,我们公开了所有竞赛条目、Docker文件以及评估基础设施,为社区提供了宝贵资源,以探索LLM的微调、过拟合和可重复性问题。

关键词

引用

@article{arxiv.2503.13506,
  title  = {The Role of Hyperparameters in Predictive Multiplicity},
  author = {Mustafa Cavus and Katarzyna Woźnica and Przemysław Biecek},
  journal= {arXiv preprint arXiv:2503.13506},
  year   = {2025}
}

备注

16 pages, 4 figures