基于近似 Neyman 分配的大型语言模型主动测试
人工智能
2026-05-20 v2
摘要
大型语言模型(LLM)从预训练到测试时扩展都需要可靠的评估,这使得评估成为一项反复出现的成本,而非一次性成本。随着模型规模的增长和目标任务对专家标注者的需求日益增加,每次评估所需的计算和标注成本迅速上升。主动测试旨在通过从评估池中一个规模小但信息丰富的子集来近似评估结果,从而缓解这一瓶颈。然而,现有方法主要针对分类任务,在生成任务上则表现不佳。我们引入了一种针对生成任务的新型主动测试算法。该方法利用来自代理模型的语义熵对评估池进行分层,然后基于从这些代理模型中提取的信号进行近似 Neyman 分配。在多个语言和多模态基准测试以及一系列代理-目标模型对上,我们的方法显著优于基线,并紧密追踪 Oracle-Neyman,与均匀采样相比 MSE 降低了高达 28%,平均节省了 22.9% 的预算。
引用
@article{arxiv.2605.10075,
title = {Active Testing of Large Language Models via Approximate Neyman Allocation},
author = {Zeli Liu and Jiancheng Zhang and Cong Liu and Yinglun Zhu},
journal= {arXiv preprint arXiv:2605.10075},
year = {2026}
}