中文

大型语言模型用于RNA次级结构预测的综合基准测试

人工智能 2025-02-04 v2 机器学习 生物大分子

摘要

受大型语言模型(LLM)在DNA和蛋白质领域取得成功的启发,最近开发了多个针对RNA的LLM。RNA-LLM利用大规模RNA序列数据集进行自监督学习,以语义丰富的数值向量表示每个RNA碱基。其假设是,获得高质量的RNA表征可以增强数据成本高的下游任务。其中,预测次级结构是揭示RNA功能机制的基本任务。本文在统一的深度学习框架中,对几种预训练RNA-LLM进行全面实验分析,比较它们在RNA次级结构预测任务中的表现。对RNA-LLM进行了在基准数据集上的逐步泛化难度评估。结果显示,两个LLM明显优于其他模型,揭示了在低同源性情景下泛化存在的显著挑战。

关键词

引用

@article{arxiv.2410.16212,
  title  = {Comprehensive benchmarking of large language models for RNA secondary structure prediction},
  author = {L. I. Zablocki and L. A. Bugnon and M. Gerard and L. Di Persia and G. Stegmayer and D. H. Milone},
  journal= {arXiv preprint arXiv:2410.16212},
  year   = {2025}
}