SCARE:面向可靠电子健康记录问答的数据集
计算与语言
2025-12-23 v2 数据库
摘要
最新进展表明,大型语言模型(LLM)已能够开发出基于自然语言的文本到 SQL 模型,使临床医生能够查询存储在电子健康记录(EHR)中的结构化数据。然而,在安全关键的临床环境中部署这些模型进行 EHR 问答(QA)系统仍面临挑战:不正确的 SQL 查询——无论是由模型错误还是用户输入问题引起——都可能削弱临床决策并危及患者安全。尽管先前工作主要致力于提高 SQL 生成准确性或在执行前过滤问题,但缺乏用于评估独立后置验证机制(即在执行前检查和验证生成 SQL 的组件)的统一基准,这在安全部署中至关重要。为填补这一空白,我们引入 SCARE,作为评估在 EHR QA 系统中作为后置安全层的各种方法的数据集。SCARE 评估联合任务:(1)分类问题可解性(即确定问题是可解、模糊还是不可解),以及(2)验证或纠正候选 SQL 查询。该基准包含 4,200 组问题、候选 SQL 查询和预期模型输出的三元组,基于 MIMIC-III、MIMIC-IV 和 eICU 数据库。它涵盖了多样化的问题集合和由七种不同文本到 SQL 模型生成的相应候选 SQL 查询,确保了真实且具挑战性的评估。使用 SCARE,我们对从两种阶段方法到智能体框架的各种方法进行基准测试。我们的实验揭示了问题分类与 SQL 错误纠正之间的关键权衡,突显了关键挑战并指明了未来研究的方向。
引用
@article{arxiv.2511.17559,
title = {SCARE: A Benchmark for SQL Correction and Question Answerability Classification for Reliable EHR Question Answering},
author = {Gyubok Lee and Woosog Chay and Edward Choi},
journal= {arXiv preprint arXiv:2511.17559},
year = {2025}
}
备注
ML4H 2025 Proceedings