中文

ESL-Bench:一个事件驱动的合成纵向健康智能体基准

人工智能 2026-04-06 v1

摘要

纵向健康智能体必须跨多源轨迹进行推理,这些轨迹结合了连续设备流、稀疏临床检查和间歇性生活事件——然而评估它们很困难:真实世界数据无法大规模发布,且时间定位的归因问题很少能在没有结构化真实答案的情况下获得确定性解答。我们提出了ESL-Bench,一个事件驱动的合成框架和基准,提供100个合成用户,每个用户拥有1-5年的轨迹,包括健康档案、多阶段叙事计划、每日设备测量、定期检查记录和带有每个指标显式影响参数的事件日志。每个指标遵循由具有S形onset、指数衰减核的离散事件驱动的基线随机过程,在饱和和投影约束下运行;一个混合管道将稀疏语义信息委托给LLM规划,将密集指标动态委托给具有硬生理边界约束的算法模拟。每个用户配对100个评估查询,涵盖五个维度——查找、趋势、比较、异常、解释——分为简单、中等和困难三个层级,所有真实答案均可从记录的指标-事件关系中程序化计算。评估了13种方法,涵盖带工具的LLM、数据库原生智能体和记忆增强RAG,我们发现数据库智能体(48-58%)大幅优于记忆RAG基线(30-38%),差距集中在需要多跳推理和证据归因的比较和解释查询上。

关键词

引用

@article{arxiv.2604.02834,
  title  = {ESL-Bench: An Event-Driven Synthetic Longitudinal Benchmark for Health Agents},
  author = {Chao Li and Cailiang Liu and Ang Gao and Kexin Deng and Shu Zhang and Langping Xu and Xiaotong Shi and Xionghao Ding and Jian Pei and Xun Jiang},
  journal= {arXiv preprint arXiv:2604.02834},
  year   = {2026}
}