中文

F5C-finder:一种用于预测mRNA上5-甲酰胞嘧啶修饰的可解释集成生物语言模型

基因组学 2024-04-23 v1 人工智能 机器学习

摘要

作为一种普遍存在且动态调控的表观遗传修饰,5-甲酰胞嘧啶(f5C)在各种生物过程中至关重要。然而,传统的f5C检测实验方法通常费力且耗时,限制了其全面绘制转录组中f5C位点的能力。虽然计算方法提供了一种经济高效且高通量的替代方案,但迄今为止尚未开发出针对f5C的识别模型。受自然语言处理中语言模型的启发,本研究提出了f5C-finder,一种基于多头注意力的集成神经网络模型,用于识别f5C。采用五种不同的特征提取方法构建了五个人工神经网络,随后通过集成学习将这些网络整合成f5C-finder。10折交叉验证和独立测试表明,f5C-finder达到了最先进的性能,AUC分别为0.807和0.827。结果突显了生物语言模型在捕获基因组中顺序(序列)和功能含义(语义)方面的有效性。此外,内置的可解释性使我们能够理解模型正在学习什么,从而在识别关键序列元素与更深入地探索其生物学功能之间架起桥梁。

关键词

引用

@article{arxiv.2404.13265,
  title  = {F5C-finder: An Explainable and Ensemble Biological Language Model for Predicting 5-Formylcytidine Modifications on mRNA},
  author = {Guohao Wang and Ting Liu and Hongqiang Lyu and Ze Liu},
  journal= {arXiv preprint arXiv:2404.13265},
  year   = {2024}
}

备注

34 pages, 10 figures, journal