将主动测试扩展至大型语言模型
机器学习
2025-11-26 v2 机器学习
摘要
主动测试通过精心的数据获取实现对预测模型的标签高效评估,但可能造成显著的计算成本。我们识别出能够降低成本的措施,从而将主动测试扩展到大型语言模型(LLMs)。特别地,我们展示,使用基于情境学习的_surrogate 模型(用于引导数据获取)即可低成本构建,且不需要在主动测试循环内更新,也可以小于目标模型。我们甚至发现可以在不对目标模型做出预测的情况下做出良好的数据获取决策。因此,我们能够对 LLM 性能实现更精确的评估,而相较于使用随机获取的数据,效果更佳。我们 additionally 引入了一个评估误差的 bootstrap 估计器,我们展示它是评估主动测试在单次运行中是否顺利进行的有用指标。
关键词
引用
@article{arxiv.2508.09093,
title = {Scaling Up Active Testing to Large Language Models},
author = {Gabrielle Berrada and Jannik Kossen and Freddie Bickford Smith and Muhammed Razzak and Yarin Gal and Tom Rainforth},
journal= {arXiv preprint arXiv:2508.09093},
year = {2025}
}
备注
Published at NeurIPS 2025