PepHarmony:用于整合序列与基于结构的多肽编码的多视图对比学习框架
机器学习
2024-01-23 v1 人工智能
计算工程、金融与科学
生物大分子
摘要
蛋白质语言模型的最新进展极大地促进了多肽序列表示的发展。尽管该领域已有广泛探索,但由于难以捕捉多肽复杂且有时不稳定的结构,针对多肽特定需求定制的预训练模型在很大程度上仍未得到解决。本研究为基于序列的多肽编码任务引入了一种新颖的多视图对比学习框架 PepHarmony。PepHarmony 创新性地通过对比学习将序列级和结构级信息结合到一个序列级编码模块中。我们仔细从 Protein Data Bank (PDB) 和 AlphaFold 数据库中选择了数据集,以涵盖广泛的多肽序列和结构。实验数据表明,与基线模型和微调模型相比,PepHarmony 在捕捉多肽序列与结构之间的复杂关系方面表现出卓越的能力。我们通过广泛的消融研究证实了模型的鲁棒性,这些研究强调了对比损失和策略性数据排序在增强预测性能中的关键作用。所提出的 PepHarmony 框架是对多肽表示的重要贡献,并为未来在多肽药物发现和多肽工程中的应用提供了有价值的见解。我们已将本研究中使用的所有源代码通过 GitHub 公开,网址为 https://github.com/zhangruochi/PepHarmony 或 http://www.healthinformaticslab.org/supp/。
引用
@article{arxiv.2401.11360,
title = {PepHarmony: A Multi-View Contrastive Learning Framework for Integrated Sequence and Structure-Based Peptide Encoding},
author = {Ruochi Zhang and Haoran Wu and Chang Liu and Huaping Li and Yuqian Wu and Kewei Li and Yifan Wang and Yifan Deng and Jiahui Chen and Fengfeng Zhou and Xin Gao},
journal= {arXiv preprint arXiv:2401.11360},
year = {2024}
}
备注
25 pages, 5 figures, 3 tables