中文

ProEval:面向生成式AI评估的主动失效发现与高效性能估计

机器学习 2026-04-28 v1 人工智能 机器学习

摘要

评估生成式AI模型日益昂贵,由于推理缓慢、评审成本高昂以及模型和基准快速增长的生态系统。我们提出ProEval,一个主动评估框架,利用迁移学习高效估计性能并识别失效案例。ProEval采用预训练的高斯过程(GP)作为性能评分函数的代理模型,将模型输入映射到诸如错误严重程度或安全违规等指标。通过将性能估计建模为贝叶斯数值积分(BQ)和失效发现建模为次阈值采样,我们开发了不确定性感知的决策策略,主动选择或综合最具信息性的输入进行测试。理论上,我们证明了基于预训练GP的BQ估计器是无偏且有界的。实验方面,针对推理、安全对齐和分类基准进行大量实验,表明ProEval在竞争基准中显著更高效。它只需8-65倍的样本即可获得接近真实值的估计,同时在更严格的评估预算下揭示更多样的失效案例。

关键词

引用

@article{arxiv.2604.23099,
  title  = {ProEval: Proactive Failure Discovery and Efficient Performance Estimation for Generative AI Evaluation},
  author = {Yizheng Huang and Wenjun Zeng and Aditi Kumaresan and Zi Wang},
  journal= {arXiv preprint arXiv:2604.23099},
  year   = {2026}
}

备注

Our open-sourced code and data can be found at https://github.com/google-deepmind/proeval