中文

人工神经网络用于蛋白质一级序列结构预测的最优编码研究

机器学习 2020-08-05 v1 神经与进化计算 定量方法

摘要

近年来,机器学习与神经网络的使用急剧增长,主要归因于数据可及性的不断提升和计算能力的增长。利用机器学习进行预测任务已变得愈发容易。蛋白质结构预测是神经网络日益流行且取得成功的一个领域。尽管功能强大,人工神经网络的使用仍需选择最恰当的输入/输出编码、架构和类别以产生最优结果。在本研究中,我们探索并评估了若干常规及新提出的输入编码的影响,并选定了最优架构。我们考虑了 11 种输入编码变体、11 种备选窗口大小以及 7 种不同架构。在三个月期间,我们总计评估了 2541 种排列组合,应用于超过 10000 个蛋白质结构的训练与测试。我们的研究得出结论:独热编码、LSTM 的使用以及 9、11 和 15 的窗口大小可产生最优结果。通过此优化,我们能够将蛋白质结构预测质量提升至:预测 {\phi} 二面角在 14{\deg} - 16{\deg} 以内,{\psi} 二面角在 23{\deg}- 25{\deg} 以内。与先前类似研究相比,这是一个显著改进。

关键词

引用

@article{arxiv.2008.00539,
  title  = {An Investigation in Optimal Encoding of Protein Primary Sequence for Structure Prediction by Artificial Neural Networks},
  author = {Aaron Hein and Casey Cole and Homayoun Valafar},
  journal= {arXiv preprint arXiv:2008.00539},
  year   = {2020}
}