ProEval:面向生成式AI评估的主动失效发现与高效性能估计
机器学习
2026-04-28 v1 人工智能
机器学习
摘要
评估生成式AI模型日益昂贵,由于推理缓慢、评审成本高昂以及模型和基准快速增长的生态系统。我们提出ProEval,一个主动评估框架,利用迁移学习高效估计性能并识别失效案例。ProEval采用预训练的高斯过程(GP)作为性能评分函数的代理模型,将模型输入映射到诸如错误严重程度或安全违规等指标。通过将性能估计建模为贝叶斯数值积分(BQ)和失效发现建模为次阈值采样,我们开发了不确定性感知的决策策略,主动选择或综合最具信息性的输入进行测试。理论上,我们证明了基于预训练GP的BQ估计器是无偏且有界的。实验方面,针对推理、安全对齐和分类基准进行大量实验,表明ProEval在竞争基准中显著更高效。它只需8-65倍的样本即可获得接近真实值的估计,同时在更严格的评估预算下揭示更多样的失效案例。
引用
@article{arxiv.2604.23099,
title = {ProEval: Proactive Failure Discovery and Efficient Performance Estimation for Generative AI Evaluation},
author = {Yizheng Huang and Wenjun Zeng and Aditi Kumaresan and Zi Wang},
journal= {arXiv preprint arXiv:2604.23099},
year = {2026}
}
备注
Our open-sourced code and data can be found at https://github.com/google-deepmind/proeval