中文

开发与维护开源AI评估存储库:挑战与见解

计算与语言 2025-07-10 v1 人工智能

摘要

AI评估已成为评估大型语言模型能力和安全性的关键工具。本文提出了来自八个月持续维护inspect_evalsinspect\_evals(一个包含70多个社区贡献AI评估的开源存储库)的实用见解。我们确定了在实施和维护AI评估方面的关键挑战,并开发了解决方案,包括:(1)用于扩展社区贡献的结构化队列管理框架;(2)用于最优抽样和跨模型比较的统计方法,包括不确定性量化;(3)用于可重复性的系统化质量控制流程。我们的分析表明,AI评估需要超越传统软件开发实践的专业化基础设施、统计严谨性和社区协调。

关键词

引用

@article{arxiv.2507.06893,
  title  = {Developing and Maintaining an Open-Source Repository of AI Evaluations: Challenges and Insights},
  author = {Alexandra Abbas and Celia Waggoner and Justin Olive},
  journal= {arXiv preprint arXiv:2507.06893},
  year   = {2025}
}