自蒸馏提升DNA序列推断
机器学习
2024-05-15 v1
摘要
自监督预训练(SSP)已被认为是提升各种下游任务预测准确率的方法。然而,其对DNA序列的有效性仍受到一定限制。这一限制主要源于基因组学中大多数现有的SSP方法侧重于对单个序列进行掩码语言建模,忽略了编码多个序列间统计信息的关键方面。为了克服这一挑战,我们引入了一种创新的深度神经网络模型,该模型在“学生”和“教师”子网络之间结合了协同学习。在该模型中,学生子网络对核苷酸采用掩码学习,并通过指数移动平均方法逐步将其参数调整至教师子网络。同时,两个子网络进行对比学习,从输入序列的两个增强表示中获取洞见。这种自蒸馏过程使我们的模型能够有效吸收来自单个序列的上下文信息和跨序列群体的分布数据。我们使用人类参考基因组进行了初步预训练来验证我们的方法,随后将其应用于20个下游推断任务。这些实验的经验结果表明,我们的新方法在大多数任务上显著提升了推断性能。我们的代码可在 https://github.com/wiedersehne/FinDNA 获取。
引用
@article{arxiv.2405.08538,
title = {Self-Distillation Improves DNA Sequence Inference},
author = {Tong Yu and Lei Cheng and Ruslan Khalitov and Erland Brandser Olsson and Zhirong Yang},
journal= {arXiv preprint arXiv:2405.08538},
year = {2024}
}