确保通用生成式AI系统的可复现性:一个面向回归测试和开放数据集的框架
计算与语言
2025-05-07 v1 人工智能
摘要
对于行为可能随每次模型更新或提示修订而漂移的生成式AI系统而言,可复现性和可靠性仍然是紧迫的挑战。我们引入了GPR-bench,一个轻量级、可扩展的基准,它将回归测试操作化为通用用例。GPR-bench将一个开放的、双语(英语和日语)数据集与一个自动化评估流程相结合,该数据集涵盖八个任务类别(例如,文本生成、代码生成和信息检索),每个任务类别包含10个场景(每种语言共80个测试用例),评估流程采用“LLM-as-a-Judge”对正确性和简洁性进行评分。在三个最近的模型版本——gpt-4o-mini、o3-mini和o4-mini——以及两种提示配置(默认与简洁写作指令)上的实验揭示了异质的质量。我们的结果表明,较新的模型通常提高了正确性,但差异不大且不具有统计显著性,这表明GPR-bench可能不足以区分最近的模型版本。相比之下,简洁写作指令显著提升了简洁性(+12.37个百分点,Mann-Whitney U检验:p < 0.001,效应量 r = 0.2995),而对准确性的影响极小(-1.7个百分点),这证明了提示工程的有效性。GPR-bench在MIT许可证下发布,降低了启动可复现性监控的门槛,并为社区驱动的扩展提供了基础,同时也为快速发展的语言模型的基准设计提出了重要考量。
引用
@article{arxiv.2505.02854,
title = {Ensuring Reproducibility in Generative AI Systems for General Use Cases: A Framework for Regression Testing and Open Datasets},
author = {Masumi Morishige and Ryo Koshihara},
journal= {arXiv preprint arXiv:2505.02854},
year = {2025}
}
备注
15 pages, 10 figures