中文

ScenarioBench:面向Text-to-SQL和RAG的基于情景的合规评估

计算与语言 2025-09-30 v1

摘要

ScenarioBench是一个面向Text-to-SQL和检索增强生成(RAG)的政策导向、情景感知基准。每个YAML情景包括一个无peek金标准包,包含预期决策、最小见证情形、管辖条款集合以及标准SQL,从而实现对系统所做决定及其原因的端到端评分。系统必须使用与政策典范相同的条款ID来为输出提供依据,使解释具有可验证性和可审计性。评估器报告决策准确率、情形质量(完整性、正确性、顺序)、检索效果、SQL正确性(通过结果集等价性)、政策覆盖率、延迟以及解释幻觉率。归一化情景难度指数(SDI)和预算派生版本(SDI-R)综合考虑检索难度和时间限制。与以往的Text-to-SQL或KILT/RAG基准相比,ScenarioBench将每个决策与条款水平证据相联系,遵循严格的依据和无peek规则,将收益引向明确时间预算下的解释质量。

关键词

引用

@article{arxiv.2509.24212,
  title  = {ScenarioBench: Trace-Grounded Compliance Evaluation for Text-to-SQL and RAG},
  author = {Zahra Atf and Peter R Lewis},
  journal= {arXiv preprint arXiv:2509.24212},
  year   = {2025}
}

备注

Accepted for presentation at the LLMs Meet Databases (LMD) Workshop, 35th IEEE International Conference on Collaborative Advances in Software and Computing, 2025. Workshop website: https://sites.google.com/view/lmd2025/home