重要性抽样是你所需要的:通过重用现有基准预测 LLM 在新基准上的表现
人工智能
2025-08-05 v1
摘要
随着大型语言模型的快速发展,代码生成已成为评估 LLM 能力的关键基准。然而,现有基准面临两个主要挑战:(1) 构建高质量测试套件和参考解答的成本不断攀升,(2) 数据污染风险不断增加,这削弱了基于基准的评估可靠性。本文提出了 BIS,这是一个以提示词为中心的评估框架,使我们能够在不依赖 ground-truth 的情况下预测 LLM 在代码生成任务上的表现。Rather than执行生成的代码,BIS 通过仅分析提示词分布来估计性能指标。基于重要性抽样理论,采用 Importance Weighted Autoencoder 实现,将来自现有标注基准的样本重新加权,以估计在新、未见基准上的表现。为稳定估计,我们引入权重截断策略并计算在拟合分布上的边际期望。BIS 是一个补充工具,支持资源受限下的基准开发和验证,为提示词选择和数据污染评估提供可操作且快速的反馈。我们在 8000 个评估点上进行了广泛实验,涉及 4 个 CodeLlama 模型和 9 个多样化基准。我们的框架在代码正确性得分上实现平均绝对预测误差为 1.1%,最佳误差为 0.3%,最差误差为 1.9%。该方法也能很好地推广到其他指标,pass@1 的平均绝对误差为 2.15%。这些结果表明 BIS 的可靠性和广泛适用性,显著降低了 LLM 在代码相关任务中进行基准测试的成本和工作量。
引用
@article{arxiv.2508.01203,
title = {Importance Sampling is All You Need: Predict LLM's performance on new benchmark by reusing existing benchmark},
author = {Junjie Shi and Wei Ma and Shi Ying and Lingxiao Jiang and Yang liu and Bo Du},
journal= {arXiv preprint arXiv:2508.01203},
year = {2025}
}