AcTracer:基于多阶段抽样的大型语言模型主动测试框架
软件工程
2025-06-12 v2 人工智能
计算与语言
摘要
性能评估在大型语言模型(LLM)开发生命周期中起着关键作用。它估计模型的能力,阐明行为特征,并有助于识别潜在问题和局限性,从而指导后续改进。鉴于 LLM 的多样化任务处理能力源于大量训练数据,全面评估也需要大量、经过良好注释且具有代表性的测试数据来评估 LLM 在各种下游任务中的性能。然而,高质量测试数据的需求通常需要大量时间、计算资源和人工工作,有时会导致评估效率低下或不可行。为此,研究人员提出了主动测试,通过选择测试数据的子集来估计整体性能。然而,现有的主动测试方法在面对 LLM 的独特新挑战(例如多样化的任务类型、模型复杂度增加以及训练数据不可用)时往往效率低下,甚至无法适用。为缓解此类限制并加速 LLM 的开发周期,本文提出 AcTracer,一个为 LLM 量身定制的主动测试框架,通过战略性地选择小规模测试数据子集来实现对 LLM 性能的更准确估计。AcTracer 利用 LLM 的内部和外部信息指导测试抽样过程,通过基于多阶段池的主动选择降低方差。我们的实验结果表明,AcTracer 在各种任务中相较于现有方法实现了领先的性能。
引用
@article{arxiv.2408.03573,
title = {AcTracer: Active Testing of Large Language Model via Multi-Stage Sampling},
author = {Yuheng Huang and Jiayang Song and Qiang Hu and Felix Juefei-Xu and Lei Ma},
journal= {arXiv preprint arXiv:2408.03573},
year = {2025}
}
备注
To appear in ACM Transactions on Software Engineering and Methodology (2025)