中文

面向企业规模 RAG 系统的案例感知 LLM 评估

计算与语言 2026-02-25 v1 人工智能

摘要

企业检索增强生成(RAG)助手在多轮、基于案例的工作流程中运行,如技术支持和 IT 操作,其中评估必须反映操作约束、结构化标识符(如错误代码、版本)以及解决工作流程。现有的 RAG 评估框架主要针对基准样式或单轮设置设计,常常无法捕捉企业特有的失败模式,如案件误识别、工作流程错位以及跨轮的部分解决。我们提出了一个面向企业多轮 RAG 系统的案件感知 LLM 评估框架。该框架使用八项操作ally grounded 指标评估每个轮次,这些指标分离检索质量、grounding 忠诚度、答案实用性、精确度完整性以及案件/工作流程对齐。一个以严重性为导向的评分协议减少了得分膨胀,提高了跨异构企业案件的诊断清晰度。该系统使用确定性提示并严格的 JSON 输出,实现可扩展的批量评估、回归测试和生产监控。通过对两种指令调优模型在短流程和长流程中的比较研究,我们表明通用代理指标提供模糊的信号,而所提框架暴露了企业关键的权衡,这些权衡对系统改进具有可操作性。

关键词

引用

@article{arxiv.2602.20379,
  title  = {Case-Aware LLM-as-a-Judge Evaluation for Enterprise-Scale RAG Systems},
  author = {Mukul Chhabra and Luigi Medrano and Arush Verma},
  journal= {arXiv preprint arXiv:2602.20379},
  year   = {2026}
}

备注

12 pages including appendix, 6 figures