中文

RNA二级结构预测的机器学习方法:当前方法与挑战综述

生物大分子 2026-05-20 v2 生物物理 计算物理

摘要

预测RNA的二级结构是计算生物学中的核心挑战,对于理解分子功能和设计新型疗法至关重要。该领域已从基础但精度有限的热力学方法,发展到由机器学习和深度学习主导的新的数据驱动范式。这些模型直接从数据中学习折叠模式,带来了显著的性能提升。本综述调查了这些方法的现代图景,涵盖了单序列、基于进化的以及将机器学习与生物物理学相结合的混合模型。一个核心主题是该领域的“泛化危机”,即强大的模型被发现会在新的RNA家族上失效,这促使整个社区转向更严格、基于同源性感知的基准测试。为了应对数据稀缺这一根本挑战,RNA基础模型应运而生,它们从海量的未标记序列语料库中学习,以改善泛化能力。最后,我们展望了下一组主要障碍——包括准确预测假结等复杂基序、扩展到千碱基长度的转录本、纳入修饰核苷酸的化学多样性,以及将预测目标从静态结构转向更能捕捉生物学功能的动态集合。我们还强调了建立一个标准化、前瞻性的基准测试系统的必要性,以确保无偏验证并加速进展。

关键词

引用

@article{arxiv.2511.02622,
  title  = {Machine Learning for RNA Secondary Structure Prediction: a review of current methods and challenges},
  author = {Giuseppe Sacco and Giovanni Bussi and Guido Sanguinetti},
  journal= {arXiv preprint arXiv:2511.02622},
  year   = {2026}
}

备注

22 pages, 3 figures. Updated version of the article published in RNA 32(4):443-456 (2026); the Foundation Models section has been revised to reflect developments since publication. The remainder of the manuscript is unchanged apart from formatting