PhyloLM:推断大语言模型的系统发育并预测其在基准测试中的性能
计算与语言
2025-12-09 v5 机器学习
种群与进化
摘要
本文介绍了 PhyloLM,一种将系统发育算法适配到大语言模型(LLM)的方法,以探索它们是否以及如何相互关联,并预测其性能特征。我们的方法基于 LLM 输出的相似性计算系统发育距离度量。所得度量随后用于构建系统发育树,这些树令人满意地捕捉了一组 111 个开源模型和 45 个闭源模型之间的已知关系。此外,我们的系统发育距离预测了在标准基准测试中的性能,从而证明了其功能有效性,并为时间高效且成本高效的 LLM 能力评估铺平了道路。总之,通过将群体遗传学概念转化为机器学习,我们提出并验证了一种工具,用于评估 LLM 的发展、关系和能力,即使在缺乏透明训练信息的情况下也是如此。
引用
@article{arxiv.2404.04671,
title = {PhyloLM : Inferring the Phylogeny of Large Language Models and Predicting their Performances in Benchmarks},
author = {Nicolas Yax and Pierre-Yves Oudeyer and Stefano Palminteri},
journal= {arXiv preprint arXiv:2404.04671},
year = {2025}
}
备注
The project code is available at https://github.com/Nicolas-Yax/PhyloLM . Published as https://iclr.cc/virtual/2025/poster/28195 at ICLR 2025. A code demo is available at https://colab.research.google.com/drive/1agNE52eUevgdJ3KL3ytv5Y9JBbfJRYqd