中文

医疗数据差距中的跨数据迁移: biomedical 数据分析中的迁移学习范围综述

机器学习 2025-06-17 v1

摘要

临床和生物医学研究在资源有限的环境中常面临着由于需要高质量数据且样本量足以构建有效模型的限制, 这些约束阻碍了稳健的模型训练, 并促使研究人员寻求从相关研究中利用现有知识以支持新研究的办法。迁移学习 (TL) 作为一种机器学习技术, 通过利用预训练模型的知识来提高新模型的性能, 在 various healthcare 领域展现出广泛的前景。尽管其概念起源于 1990 年代, 但在医学研究中的应用仍有限, 尤其是超出图像分析之外。在我们筛选 TL 在结构化临床和生物医学数据中的应用时, 我们审阅了 3,515 篇论文, 其中 55 篇符合纳入标准。在这些论文中, 仅有 2% (1/55) 利用了外部研究, 且 7% (4/55) 解决了涉及多站点合作且受隐私约束的情形。为了在医疗研究中实现可操作的 TL, 同时应对区域差异、不平等和隐私约束, 我们主张仔细识别合适的源数据和模型, 选择合适的 TL 框架, 并通过适当的基线方法来验证 TL 模型。

关键词

引用

@article{arxiv.2407.11034,
  title  = {Bridging Data Gaps in Healthcare: A Scoping Review of Transfer Learning in Biomedical Data Analysis},
  author = {Siqi Li and Xin Li and Kunyu Yu and Di Miao and Mingcheng Zhu and Mengying Yan and Yuhe Ke and Danny D'Agostino and Yilin Ning and Qiming Wu and Ziwen Wang and Yuqing Shang and Molei Liu and Chuan Hong and Nan Liu},
  journal= {arXiv preprint arXiv:2407.11034},
  year   = {2025}
}