基于氨基酸独热编码和化学编码的单序列蛋白质二级结构预测
生物大分子
2024-07-09 v1
摘要
在蛋白质二级结构预测中,序列中的每个氨基酸通常被视为一个独立的类别,并用独热向量表示。在本研究中,我们利用分子指纹和降维算法FastMap开发了两种新颖的氨基酸化学表示方法。我们证明,这两种新的化学编码可以提供关于序列中氨基酸相互作用的额外信息,而这些信息是基于LSTM的模型仅使用独热编码无法捕获的。与基于单序列的方法SPOT-1D-Single中使用的最新LSTM模型相比,我们利用独热编码和化学编码的集成模型在大多数测试集上实现了更好的准确率,同时每个编码模型所需的可训练参数减少了约九倍。我们的基于单序列的方法因其简单性、较低的资源需求以及不依赖外部序列数据而具有价值。当需要快速或初步预测,或者同源序列数据稀缺时,该方法非常有用。
引用
@article{arxiv.2407.05173,
title = {Single-Sequence-Based Protein Secondary Structure Prediction using One-Hot and Chemical Encodings of Amino Acids},
author = {Hoa Trinh and Satish Kumar Thittamaranahalli},
journal= {arXiv preprint arXiv:2407.05173},
year = {2024}
}