ClinSeekAgent:面向智能体临床推理的自动化多模态证据搜寻
摘要
大型语言模型(LLM)和智能体系统在临床决策支持方面已展现出潜力,但现有工作大多假设证据已被整理好并交给模型。然而,现实世界的临床工作流程要求智能体主动从异构来源中搜寻、迭代规划并综合多模态证据。在本文中,我们介绍了 ClinSeekAgent,这是一个用于动态多模态证据搜寻的自动化智能体框架,它将范式从被动证据消费转变为主动证据获取。仅给定一个临床查询和对原始数据源的访问权限,ClinSeekAgent 通过查询医学知识库、浏览原始电子健康记录(EHR)以及调用医学影像工具来收集证据;随着新信息的出现完善其假设;并将收集到的证据整合到有依据的临床决策中。ClinSeekAgent 既可作为前沿 LLM 的推理时智能体,也可作为将高质量智能体轨迹蒸馏到紧凑开源模型中的训练时流水线。为了验证其推理时的有效性,我们构建了 ClinSeek-Bench,它将基于固定预选证据的 Curated Input 推理与基于原始临床数据的 Automated Evidence-Seeking 配对。在纯文本 EHR 任务上,ClinSeekAgent 将 Claude Opus 4.6 的总体 F1 分数从 60.0 提升至 63.2,将 MiniMax M2.5 从 43.1 提升至 47.3,在 9 个评估的主模型中,有 7 个取得了正向的风险预测增益。在多模态任务上,ClinSeekAgent 将 Claude Opus 4.6 从 47.5 提升至 62.6(+15.1);所有评估的模型在三个 CXR 相关任务组中均有提升。我们进一步通过将智能体证据搜寻轨迹蒸馏到 ClinSeek-35B-A3B 中,验证了 ClinSeekAgent 作为训练流水线的有效性,该模型在现有 AgentEHR-Bench 上取得了 34.0 的平均 F1 分数,比其 Qwen3.5-35B-A3B 基线提高了 +11.9 分,并接近 Claude Opus 4.6。
引用
@article{arxiv.2605.20176,
title = {ClinSeekAgent: Automating Multimodal Evidence Seeking for Agentic Clinical Reasoning},
author = {Juncheng Wu and Letian Zhang and Yuhan Wang and Haoqin Tu and Hardy Chen and Zijun Wang and Cihang Xie and Yuyin Zhou},
journal= {arXiv preprint arXiv:2605.20176},
year = {2026}
}
备注
24 pages, 9 figures; Project Page: https://ucsc-vlaa.github.io/ClinSeekAgent/