中文

现代大语言模型在放射科环境中充当智能体核心的潜力如何?

计算机视觉与模式识别 2025-04-09 v3

摘要

我们引入了 RadA-BenchPlat,一个用于评估大语言模型 (LLM) 在放射科环境中充当智能体核心性能的评估平台。该平台使用覆盖六个解剖区域、五种成像模态和 2,200 种疾病情景的 2,200 份放射科医生验证的合成患者记录,生成 24,200 组问答对,模拟多样化的临床情境。该平台还定义了十类工具用于智能体驱动的任务解决,并评估了领先的七款 LLM,结果显示尽管像 Claude-3.7-Sonnet 等模型在常规设置下可达到 67.1% 的任务完成率,但它们仍在复杂任务理解和工具协调方面存在挑战,限制了其作为自动化放射科系统中核心组件的潜力。通过纳入四种先进的提示工程策略——其中提示反向传播和多智能体协作分别带来了 16.8% 和 30.7% 的改进——复杂任务的性能总体提升了 48.2%。此外,还探索了自动化工具构建以提高鲁棒性,实现了 65.4% 的成功率,从而为将完全自动化的放射科应用未来整合到临床实践中提供了有前景的见解。我们的所有代码和数据均公开于 https://github.com/MAGIC-AI4Med/RadABench。

关键词

引用

@article{arxiv.2412.09529,
  title  = {How Well Can Modern LLMs Act as Agent Cores in Radiology Environments?},
  author = {Qiaoyu Zheng and Chaoyi Wu and Pengcheng Qiu and Lisong Dai and Ya Zhang and Yanfeng Wang and Weidi Xie},
  journal= {arXiv preprint arXiv:2412.09529},
  year   = {2025}
}