中文

一种面向数据高效医学基础模型预训练的自监督范式:V信息优化框架

机器学习 2025-04-08 v4

摘要

自监督预训练医学基础模型在大规模数据集上展现了卓越性能。近期研究通过引入数据高效学习方法对这一常见范式提出了挑战,证明仅仅增加预训练数据量并不一定能提升模型性能。然而,现有方法仍缺乏明确标准,其潜在理论基础尚不清楚。本文作为首次尝试解决这一局限性,将V信息引入基础模型的自监督预训练,为样本选择提供理论基础。我们的推导证实,通过优化V信息,样本选择可被视为一个优化问题——在有限训练数据下,选择多样且具有挑战性的样本能够提升模型性能。在此指导下,我们开发了一种优化的数据高效学习方法(OptiDEL),用于在真实医学领域中优化V信息,生成更多样化且更难处理的样本。我们将OptiDEL方法与现有最先进方法进行了对比,发现OptiDEL在八个不同数据集上始终优于现有方法,仅使用5%预训练数据训练的基础模型即可达到比全量数据训练高出6.2%的mIoU。值得注意的是,OptiDEL在使用20倍更少训练数据的情况下,相比竞争方法平均提升了4.7%的mIoU。

关键词

引用

@article{arxiv.2408.07107,
  title  = {A Self-Supervised Paradigm for Data-Efficient Medical Foundation Model Pre-training: V-information Optimization Framework},
  author = {Wenxuan Yang and Hanyu Zhang and Weimin Tan and Yuqi Sun and Bo Yan},
  journal= {arXiv preprint arXiv:2408.07107},
  year   = {2025}
}