中文

拼布学习:一种面向多源异构生物医学数据整合分析的范式

机器学习 2024-02-09 v2 人工智能 密码学与安全

摘要

医疗保健中的机器学习(ML)在提升患者照护、人群健康以及医疗服务提供者工作流程方面带来了众多机遇。然而,由于数据隐私、数据源异构以及无法充分利用多种数据模态等挑战,其现实中的临床与成本收益仍然有限。在本观点论文中,我们提出“拼布学习”(patchwork learning, PL)这一新颖范式,通过整合由不同数据模态(如临床自由文本、医学图像、组学数据)组成且分布于相互独立且安全站点的异构数据集中的信息,来应对上述局限。PL 在保护数据隐私的同时实现互补数据源的同步利用,从而支持开发更具整体性与泛化能力的 ML 模型。我们阐述了拼布学习的概念及其在医疗保健中的当前实现,探讨了应对各类医疗挑战的潜在机遇与适用数据源。PL 利用跨站点的桥接模态或重叠特征空间来促进信息共享与缺失数据填补,进而解决相关预测任务。我们讨论了 PL 所面临的挑战(其中许多与联邦学习与多模态学习共有),并为该领域的未来研究提供建议。通过提供更为全面的医疗数据整合方法,拼布学习有望革新 ML 模型的临床适用性。该范式有望在个性化与泛化性之间取得平衡,最终改善患者体验、提升人群健康并优化医疗服务提供者的工作流程。

关键词

引用

@article{arxiv.2305.06217,
  title  = {Patchwork Learning: A Paradigm Towards Integrative Analysis across Diverse Biomedical Data Sources},
  author = {Suraj Rajendran and Weishen Pan and Mert R. Sabuncu and Yong Chen and Jiayu Zhou and Fei Wang},
  journal= {arXiv preprint arXiv:2305.06217},
  year   = {2024}
}