乌鸦能否孵出猎鹰?血统关系在大语言模型性能预测中的作用
计算与语言
2025-08-11 v2
摘要
在大规模微调或模型合并之前,准确预测大语言模型(LLM)的性能可显著降低计算开销与开发时间。尽管诸如标度律(scaling laws)等先前方法已考虑了参数量或训练 token 数等全局因素,但它们往往忽略了显式的血统关系——即哪些模型由哪些父模型衍生或合并而来。本文提出一种新颖的血统正则化矩阵分解(LRMF)框架,通过图拉普拉斯正则化对 LLM 之间的祖代关联进行编码。借助多跳父子连接,LRMF 在实例级与基准级性能预测任务上均稳定优于传统矩阵分解与协同过滤方法。在大规模实验中,我们涵盖了 2,934 个公开可用的 Hugging Face 模型以及跨 6 个主要基准的 21,000 余个实例,结果表明,引入血统约束后,预测结果与真实性能之间的 Pearson 相关系数较基线方法最高可提升 0.15–0.30。此外,LRMF 能有效缓解冷启动问题,即便在数据极少的情况下,也能为新衍生或新合并的模型提供准确估计。这一基于血统的策略为现代 LLM 开发中超参数调优、数据选择与模型组合提供了一种资源高效的指导方式。
引用
@article{arxiv.2504.19811,
title = {Can a Crow Hatch a Falcon? Lineage Matters in Predicting Large Language Model Performance},
author = {Takuya Tamura and Taro Yano and Masafumi Enomoto and Masafumi Oyamada},
journal= {arXiv preprint arXiv:2504.19811},
year = {2025}
}