中文

医疗数据的联邦规则集成方法

机器学习 2026-04-21 v1 统计方法学

摘要

机器学习已成为医学研究的核心工具,日益被应用于临床环境以支持诊断和决策;然而,其有效性取决于获取大规模且多样化的数据集,而这些数据集往往局限于单个机构。尽管跨机构整合数据可解决这一限制,但隐私法规和数据所有权约束阻碍了这些努力。联邦学习通过不共享原始数据即可进行协作模型训练;然而,大多数方法依赖复杂的体系结构,缺乏可解释性,限制了其在临床中的应用。因此,我们提出了联邦RuleFit框架,用于构建分布式环境下的统一且可解释的全局模型。它集成了三个组件:基于差分隐私直方图的预处理,用于估计共享截断值,实现一致的规则定义并减少客户端间的异质性;使用共享截断值的局部规则生成;以及通过1\ell_1正则化优化的联邦双平均算法进行系数估计,以实现稀疏且一致的变量选择。在仿真研究中,所提方法的性能相当于集中式RuleFit,同时优于现有的联邦方法。实际应用表明,其能够以具竞争力的预测准确性提供可解释洞察。因此,所提框架为联邦学习环境中的可解释且可靠建模提供了实用且有效的解决方案。

关键词

引用

@article{arxiv.2604.17956,
  title  = {Federated Rule Ensemble Method in Medical Data},
  author = {Ke Wan and Kensuke Tanioka and Toshio Shimokawa},
  journal= {arXiv preprint arXiv:2604.17956},
  year   = {2026}
}