中文

FedAgentBench:面向基于服务器-客户端 LLM 智能体的真实联邦医学图像分析自动化

机器学习 2025-09-30 v1 人工智能 计算机视觉与模式识别 分布式、并行与集群计算 多智能体系统

摘要

联邦学习(FL)允许在医疗站点之间协作训练模型而无需共享敏感患者数据。然而,真实世界的 FL 部署常常受到复杂操作挑战的阻碍,这些挑战需要大量人工投入。这包括:(a) 选择合适的客户端(医院),(b) 协调中央服务器与客户端之间的工作,(c) 客户端级别的数据预处理,(d) 跨客户端统一非标准化的数据和标签,以及 (e) 基于用户指令和跨客户端数据特征选择 FL 算法。然而,现有的 FL 工作忽视了这些实际操作瓶颈。这些操作瓶颈推动了自主、智能体驱动的 FL 系统的需求,其中每个医院客户端的智能体和中央服务器智能体协作管理 FL 设置和模型训练,将人工干预降至最低。为此,我们首先提出了一种智能体驱动的 FL 框架,该框架涵盖了从客户端选择到训练完成的真实 FL 工作流关键阶段,以及一个名为 FedAgentBench 的基准,用于评估大语言模型(LLM)智能体自主协调医疗 FL 的能力。我们的框架包含 40 种 FL 算法,每种算法都针对不同的任务特定需求和跨客户端特征进行了定制。此外,我们引入了一组跨越 201 个精心策划数据集的复杂任务,模拟了 6 种特定模态的真实医疗环境,即皮肤镜检查、超声、眼底、病理组织学、磁共振成像和 X 射线。我们评估了 14 个开源和 10 个专有 LLM 的智能体性能,涵盖小、中、大模型规模。虽然一些智能体核心(如 GPT-4.1 和 DeepSeek V3)可以自动化 FL 流水线的各个阶段,但我们的结果表明,基于隐式目标的更复杂、相互依赖的任务即使对最强的模型仍然具有挑战性。

关键词

引用

@article{arxiv.2509.23803,
  title  = {FedAgentBench: Towards Automating Real-world Federated Medical Image Analysis with Server-Client LLM Agents},
  author = {Pramit Saha and Joshua Strong and Divyanshu Mishra and Cheng Ouyang and J. Alison Noble},
  journal= {arXiv preprint arXiv:2509.23803},
  year   = {2025}
}