中文

面向基础模型高效预训练的医学数据有效学习基准

机器学习 2024-08-19 v3 人工智能 计算机视觉与模式识别

摘要

在海量数据集上预训练的基础模型取得了前所未有的泛化能力。然而,在预训练中消耗大量计算资源来使用如此庞大的数据量真的是必要的吗?本文介绍了数据有效学习,旨在以最具影响力的方式使用数据来预训练基础模型。这涉及关注数据质量而非数量的策略,确保用于训练的数据具有高信息价值。数据有效学习在加速基础模型训练、降低计算成本和节省数据存储方面发挥着深远作用,随着近年来医学数据量增长超出许多人的预期,这一点尤为重要。然而,由于缺乏标准和全面的基准,医学数据有效学习的研究很少。为了填补这一空白,本文引入了一个专门用于评估医学领域数据有效学习的综合基准。该基准包括一个包含来自 31 个医疗中心的数百万数据样本的数据集、一个用于比较的基线方法和一个客观衡量数据有效学习性能的新评估指标。我们广泛的实验结果表明,基线 MedDEL 仅用 5% 的数据即可实现与原始大型数据集相当的性能。建立这样一个开放的数据有效学习基准对于医学基础模型研究社区至关重要,因为它促进了数据的高效使用,推动了协作突破,并促进了具有成本效益、可扩展和有影响力的医疗解决方案的发展。

关键词

引用

@article{arxiv.2401.17542,
  title  = {A Medical Data-Effective Learning Benchmark for Highly Efficient Pre-training of Foundation Models},
  author = {Wenxuan Yang and Weimin Tan and Yuqi Sun and Bo Yan},
  journal= {arXiv preprint arXiv:2401.17542},
  year   = {2024}
}