探究大规模生物基础模型预训练中的数据修剪技术
机器学习
2026-02-10 v2 人工智能
计算工程、金融与科学
摘要
生物基础模型(BioFMs)是基于大规模生物序列预训练的模型,最近在为多样化的下游生物信息学任务提供有意义的表示方面显示出强大的潜力。然而,这类模型通常依赖数以百万计至数以十亿计的训练序列和数十亿参数,导致计算成本高昂,尤其在学术实验室中,对可重复性和可及性构成严重障碍。为此,我们研究了针对BioFM预训练可行性的数据修剪问题,并提出了针对生物学领域的后处理影响导向数据修剪框架。我们的方法引入基于子集的自影响公式, enables 在低计算成本下高效估计样本重要性,并在此基础上提出两种简单且有效的选择策略,即 Top-k 影响(Top I)和覆盖导向影响(CCI)。我们在两个具有代表性的BioFMs上进行了实证验证,RNA-FM和ESM-C。对于RNA任务,我们的方法在超过99%的极端修剪率下始终优于随机选择基线,证明了其有效性。此外,我们展示了该框架在针对蛋白质相关任务使用ESM-C时的通用性。具体而言,我们的核心集甚至在RNA和蛋白质设置下均优于随机选择的子集,这揭示了生物序列数据集中存在大量冗余。这些发现凸显了影响导向数据修剪在显著降低BioFM预训练计算成本方面的潜力,为更高效、更可及、更可持续的生物AI研究铺平了道路。
引用
@article{arxiv.2512.12932,
title = {Investigating Data Pruning for Pretraining Biological Foundation Models at Scale},
author = {Yifan Wu and Jiyue Jiang and Xichen Ye and Yiqi Wang and Chang Zhou and Yitao Xu and Jiayang Chen and He Hu and Weizhong Zhang and Cheng Jin and Jiao Yuan and Yu Li},
journal= {arXiv preprint arXiv:2512.12932},
year = {2026}
}
备注
Accepted by AAAI 2026