SeqMapPDB:一种在蛋白质组尺度上实时识别蛋白质序列代表性结构并映射残基索引的独立流程
基因组学
2023-03-01 v2 定量方法
摘要
动机:蛋白质的三维结构为理解其生化功能提供了丰富信息。为蛋白质序列确定代表性蛋白质结构对于蛋白质组尺度的分析至关重要。然而,在为一给定蛋白质序列确定代表性结构并提供准确的残基索引映射方面存在技术困难。现有的结构与序列映射数据库通常是静态的,不适用于具有频繁基因模型修订的蛋白质组研究;它们往往不能提供可靠且一致、能最大化序列覆盖度的代表性结构;此外,蛋白质异构体通常未能被妥善解析。结果:为克服这些困难,我们开发了名为 SeqMapPDB 的计算流程,以为给定序列提供高质量的代表性 PDB 结构。当存在时可提供完全覆盖序列的结构映射,否则提供最大化覆盖查询序列的一组部分非重叠结构域映射。残基索引被准确映射,异构体蛋白质得以分辨。SeqMapPDB 高效,可实时对选定版本参考基因组进行蛋白质组范围的快速映射。此外,SeqMapPDB 作为独立流程具有灵活性,可用于大规模内部序列与结构数据映射。可用性:我们的方法发布于 https://bitbucket.org/lianglabuic/seqmappdb,采用 GNU GPL 许可。
引用
@article{arxiv.2202.11551,
title = {SeqMapPDB: A Standalone Pipeline to Identify Representative Structures of Protein Sequences and Mapping Residue Indices in Real-Time at Proteome Scale},
author = {Boshen Wang and Xue Lei and Wei Tian and Alan Perez-Rathke and Yan-Yuan Tseng and Jie Liang},
journal= {arXiv preprint arXiv:2202.11551},
year = {2023}
}
备注
3 pages