基于矩阵核范数的大语言模型评估
计算与语言
2025-06-04 v3
摘要
随着大语言模型(LLM)的不断发展,有效的评估指标对于评估其压缩信息和减少冗余的能力至关重要。虽然矩阵熵等传统指标很有价值,但由于奇异值分解(SVD)的 时间复杂度,它们对于大规模模型的计算成本很高。为了解决这个问题,我们引入了矩阵核范数,它不仅可以用作量化LLM数据压缩能力的指标,而且提供了矩阵秩的凸近似,以捕捉预测判别性和多样性。通过使用 进一步近似核范数,我们可以有效评估模型的信息压缩能力。这种方法将时间复杂度降低到 ,并且无需进行SVD计算。因此,对于CEREBRAS-GPT模型,随着规模从111M增加到6.7B,矩阵核范数的速度比矩阵熵快8到24倍。随着模型规模的增大,这种性能差距变得更加明显,这在Pythia等模型的测试中得到了验证。此外,在基准测试和模型响应上的评估证实,我们提出的矩阵核范数是评估LLM性能的一种可靠、可扩展且高效的工具,在准确性和计算效率之间取得了平衡。代码可在 https://github.com/MLGroupJLU/MatrixNuclearNorm 获取。
关键词
引用
@article{arxiv.2410.10672,
title = {Large Language Model Evaluation via Matrix Nuclear-Norm},
author = {Yahan Li and Tingyu Xia and Yi Chang and Yuan Wu},
journal= {arXiv preprint arXiv:2410.10672},
year = {2025}
}
备注
21 pages