评估随机种子对微调大型语言模型的宏观与微观影响
计算与语言
2025-11-06 v2 人工智能
机器学习
摘要
尽管随机种子可能对模型性能产生影响,但其在微调大型语言模型(LLM)中的影响在很大程度上被忽略了。在本研究中,我们使用 GLUE 和 SuperGLUE 基准系统评估了随机种子对 LLM 的影响。我们通过准确率和 F1 等传统指标分析宏观层面的影响,计算它们的均值和方差以量化性能波动。为了捕捉微观层面的影响,我们引入了一种新的度量指标——一致性,用于衡量多次运行中单个预测的稳定性。我们的实验在宏观和微观层面均揭示了显著的方差,强调了在微调和评估中仔细考虑随机种子的必要性。
引用
@article{arxiv.2503.07329,
title = {Assessing the Macro and Micro Effects of Random Seeds on Fine-Tuning Large Language Models},
author = {Nghia Bui and Guergana Savova and Lijing Wang},
journal= {arXiv preprint arXiv:2503.07329},
year = {2025}
}
备注
7 pages, 5 tables, 3 figures. Accepted at IJCNLP 2025. This is the final, peer-reviewed version of the work, which supersedes and extends the unauthorized draft previously posted as arXiv:2503.07329