中文

用于生物序列预测的课程学习:以从头肽测序为例

生物大分子 2025-06-17 v1 机器学习

摘要

肽测序——从质谱数据中鉴定氨基酸序列——是蛋白质组学中的基础任务。非自回归 Transformer(NATs)已被证明对此任务高度有效,优于传统方法。与自回归模型顺序生成标记不同,NATs 通过未掩码自注意力同时预测所有位置,利用双向上下文。然而,现有的 NAT 方法通常依赖连接时序分类(CTC)损失,由于 CTC 的复杂性,这带来了显著的优化挑战并增加了训练失败的风险。为解决这些问题,我们提出了一种改进的非自回归肽测序模型,引入了结构化的蛋白质序列课程学习策略。该方法通过采样过程根据模型估计的蛋白质生成能力调整蛋白质的学习难度,从简单到复杂逐步学习肽生成。此外,我们引入了一个自优化推理时模块,利用学习到的 NAT 标记嵌入迭代改进预测,在细粒度层面提升序列准确性。我们的课程学习策略将 NAT 训练失败频率降低了超过 90%,基于在各种数据分布上的采样训练。在九个基准物种上的评估表明,我们的方法在多个指标和物种上均优于所有先前方法。

关键词

引用

@article{arxiv.2506.13485,
  title  = {Curriculum Learning for Biological Sequence Prediction: The Case of De Novo Peptide Sequencing},
  author = {Xiang Zhang and Jiaqi Wei and Zijie Qiu and Sheng Xu and Nanqing Dong and Zhiqiang Gao and Siqi Sun},
  journal= {arXiv preprint arXiv:2506.13485},
  year   = {2025}
}