中文

生成式主动测试:基于代理任务适应的高效LLM评估

计算与语言 2026-03-23 v1 人工智能

摘要

随着预训练大语言模型(Large Language Models, LLMs)的广泛采用,对特定领域(如医疗和生物医学)任务的测试集需求日益增长。然而,在开发新基准时对测试样本进行标注的成本是一个重大挑战,尤其是当需要专家标注员时。现有的主动样本选择框架为生成式问答任务提供的支持有限,选项动态变化可能影响模型决策边界。在本文中,我们提出了生成式主动测试(Generative Active Testing, GAT),这是一种基于不确定性的获取框架,利用LLMs作为代理人来指导样本选择过程。我们提出的Statement适应模块(Statement Adaptation Module)将生成式任务修改为伪分类格式,从而捕获跨无标记候选者的样本级不确定性。我们的零shot获取函数将估计误差降低约40%,相对于传统抽样基准,提供了一种可扩展的解决方案,以实现成本效益的模型基准测试。

关键词

引用

@article{arxiv.2603.19264,
  title  = {Generative Active Testing: Efficient LLM Evaluation via Proxy Task Adaptation},
  author = {Aashish Anantha Ramakrishnan and Ardavan Saeedi and Hamid Reza Hassanzadeh and Fazlolah Mohaghegh and Dongwon Lee},
  journal= {arXiv preprint arXiv:2603.19264},
  year   = {2026}
}