基于机器学习的基因组语言学分析(基因序列特征学习):预测水稻重金属响应基因的案例研究
机器学习
2025-03-24 v1 人工智能
基因组学
摘要
本研究探索了基于机器学习的基因组语言学在识别水稻(Oryza sativa)重金属响应基因中的应用。通过整合卷积神经网络和随机森林算法,我们开发了一种混合模型,能够从基因序列中提取和学习有意义的特征,如k-mer频率和理化性质。该模型在基因数据集上进行了训练和测试,取得了较高的预测性能(精确率:0.89,F1分数:0.82)。对暴露于Hg0的水稻叶片进行的RNA-seq和qRT-PCR实验揭示了与重金属响应相关的基因差异表达,从而验证了模型的预测结果。共表达网络分析鉴定出103个相关基因,文献综述表明这些基因极有可能参与重金属相关的生物过程。通过整合和比较分析结果与差异表达基因(DEGs)的分析结果,进一步证明了这种新机器学习方法的有效性。本研究强调了将机器学习与基因组语言学相结合用于大规模基因预测的有效性。它展示了一种经济高效的方法来揭示重金属响应的分子机制,并具有开发抗逆作物品种的潜在应用。
引用
@article{arxiv.2503.16582,
title = {Machine Learning-Based Genomic Linguistic Analysis (Gene Sequence Feature Learning): A Case Study on Predicting Heavy Metal Response Genes in Rice},
author = {Ruiqi Yang and Jianxu Wang and Wei Yuan and Xun Wang and Mei Li},
journal= {arXiv preprint arXiv:2503.16582},
year = {2025}
}