中文

SurgFed:面向手术视频理解的语言引导多任务联邦学习

计算机视觉与模式识别 2026-03-11 v1

摘要

手术场景多任务联邦学习(MTFL)是机器人辅助Minimally Invasive Surgery(RAS)中的关键技术,但目前在手术视频理解领域仍受到 insufficient 关注,主要源于两个关键挑战:(1)组织多样性:局部模型难以适应特定解剖部位的组织特征,在异构临床环境中表现不佳,导致局部预测不准。(2)任务多样性:服务器端聚合仅依赖梯度聚类,往往产生次优或错误的参数更新,导致定位不准确。在此基础上,我们提出 SurgFed—a 多任务联邦学习框架,实现了针对不同手术类型的手术场景分割和深度估计的联邦学习。SurgFed 由两项创新设计驱动,即语言引导通道选择(LCS)和语言引导高级聚合(LHA),以解决跨站点和跨任务的全面探索问题。技术上,LCS 首先设计了一个轻量级的个人化通道选择网络,通过预定义的文本输入增强站点特有的适应性,使局部模型能够学习特定的嵌入表示。我们进一步引入 LHA,通过预定义的文本输入采用分层跨注意力机制,建模不同站点之间的任务交互,并引导超网络进行个人化参数更新。大量实证结果表明,SurgFed 在四种手术类型下的五个公开数据集上优于当前最先进的方法。代码已发布于 https://anonymous.4open.science/r/SurgFed-070E/。

关键词

引用

@article{arxiv.2603.09496,
  title  = {SurgFed: Language-guided Multi-Task Federated Learning for Surgical Video Understanding},
  author = {Zheng Fang and Ziwei Niu and Ziyue Wang and Zhu Zhuo and Haofeng Liu and Shuyang Qian and Jun Xia and Yueming Jin},
  journal= {arXiv preprint arXiv:2603.09496},
  year   = {2026}
}