LLM就绪度评估框架:面向LLM/RAG应用的评估、可观测性与CI门控
人工智能
2026-05-22 v2 计算与语言
软件工程
摘要
我们提出了一个面向LLM和RAG应用的就绪度评估框架,它将评估转化为部署决策工作流。该系统在最小API契约下结合了自动基准测试、OpenTelemetry可观测性和CI质量门控,然后将工作流成功率、策略合规性、基于事实性、检索命中率、成本和p95延迟聚合为场景加权的就绪度分数,并辅以帕累托前沿。我们在工单路由工作流和BEIR基于事实性任务(SciFact和FiQA)上,在完整的Azure矩阵覆盖范围(跨数据集、场景、检索深度、随机种子和模型的162/162个有效单元格)内评估了该框架。结果表明,就绪度并非单一指标:在FiQA上,在k=5的SLA优先场景下,gpt-4.1-mini在就绪度和忠实度方面领先,而gpt-5.2则付出了显著的延迟代价;在SciFact上,各模型在质量上更接近,但在操作上仍可区分。工单路由回归门控始终拒绝不安全的提示变体,表明该框架可以阻止有风险的发布,而不仅仅是报告离线分数。其结果是形成了一个可复现、基于操作实践的框架,用于决定LLM或RAG系统是否准备好发布。
引用
@article{arxiv.2603.27355,
title = {LLM Readiness Harness: Evaluation, Observability, and CI Gates for LLM/RAG Applications},
author = {Alexandre Cristovão Maiorano},
journal= {arXiv preprint arXiv:2603.27355},
year = {2026}
}
备注
19 pages, 4 figures, 15 tables