从对话到查询执行:面向电子健康记录数据库智能体的用户与工具交互基准测试
人工智能
2026-03-03 v2
摘要
尽管基于大语言模型的智能体表现令人印象深刻,但由于缺乏能够充分捕捉真实临床数据访问流程的基准测试,其在电子健康记录数据访问领域的应用仍受到限制。在实践中,两大核心挑战阻碍了部署:来自模糊用户问题的查询歧义,以及用户术语与数据库条目之间的值不匹配。为解决这些问题,我们提出了EHR-ChatQA,这是一个交互式数据库问答基准测试,用于评估数据库智能体的端到端工作流程:澄清用户问题、使用工具解决值不匹配,以及生成正确的SQL以提供准确答案。为覆盖多样化的查询歧义和值不匹配模式,EHR-ChatQA在模拟环境中通过基于大语言模型的用户,在两种交互流程下评估智能体:增量查询精炼(IncreQA),用户向现有查询添加约束;以及自适应查询精炼(AdaptQA),用户在对话中途调整搜索目标。在五个独立同分布试验上使用最先进的大语言模型(如o4-mini和Gemini-2.5-Flash)进行实验,结果表明,尽管表现最好的智能体在IncreQA上的Pass@5超过90%(五次试验中至少一次成功),在AdaptQA上为60-70%,但其Pass^5(五次试验全部成功)显著更低,差距高达约60%。这些结果强调需要构建不仅高效而且鲁棒的智能体,以满足安全关键的电子健康记录领域的需求。最后,我们提供了对常见失败模式的诊断见解,以指导未来智能体开发。我们的代码和数据在https://github.com/glee4810/EHR-ChatQA上公开发布。
引用
@article{arxiv.2509.23415,
title = {From Conversation to Query Execution: Benchmarking User and Tool Interactions for EHR Database Agents},
author = {Gyubok Lee and Woosog Chay and Heeyoung Kwak and Yeong Hwa Kim and Haanju Yoo and Oksoon Jeong and Meong Hi Son and Edward Choi},
journal= {arXiv preprint arXiv:2509.23415},
year = {2026}
}
备注
ICLR 2026