面向问题跟踪与评估的生成回归分析框架 GRAFITE
计算与语言
2026-03-20 v1
摘要
大语言模型(LLMs)主要受益于其在发布时期望主题和基准测试上的性能。然而,随着时间的推移,由于在训练期间对基准数据的显著暴露,发生了严重的contamination。这会导致在测试不够小心时,模型性能被人为抬高。为解决这一挑战,我们提出GRAFITE,一个通过综合系统维持和评估模型问题的持续LLM评估平台。我们的做法使我们能够建立一个基于用户反馈随时间演变的模型问题存储库,并为评估LLMs提供一条管道,通过使用LLM-as-a-judge的质量保证(QA)测试来评估这些问题。该平台使多个模型的side-by-side比较成为可能,促进跨不同版本的回归检测。该平台可在https://github.com/IBM/grafite]上获得。演示视频可在www.youtube.com/watch?v=XFZyoleN56k]观看。
引用
@article{arxiv.2603.18173,
title = {GRAFITE: Generative Regression Analysis Framework for Issue Tracking and Evaluation},
author = {Ja Young Lee and Mírian Silva and Mohamed Nasr and Shonda Witherspoon and Enzo Bozzani and Veronique Demers and Radha Ratnaparkhi and Hui Wu and Sara Rosenthal},
journal= {arXiv preprint arXiv:2603.18173},
year = {2026}
}
备注
7 pages, 2 figures