蛋白质折叠轨迹的原位数据分析
计算工程、金融与科学
2015-11-02 v2 分布式、并行与集群计算
生物大分子
摘要
从千万亿次到百亿亿次计算机的过渡以计算机架构和技术的实质性变化为特征。依赖计算模拟的研究界由于各种担忧(如更高程度的并发、更深的内存层次、大量的I/O和通信限制)被迫重新审视数据生成和分析算法。当今的模拟通常保存所有数据以备后续分析。百亿亿次规模的模拟将要求我们在数据生成时即进行分析,并仅保存分析真正需要的数据,这必须主要在原位执行,即在本地足够快速地执行,限制内存和磁盘使用,并避免跨节点移动大数据。在本文中,我们提出了一种分布式方法,支持对大规模蛋白质折叠轨迹数据集进行原位数据分析。传统的轨迹分析方法目前遵循集中式方法,将轨迹数据集移动到中心节点,并仅在模拟完成后处理数据。相反,我们的方法仅使用局部数据在原位捕获构象信息,同时减少所考虑轨迹部分所需的存储空间。该方法一次性处理输入轨迹数据,打破了传统分析的集中式方法,避免了轨迹数据的移动,并且仍然在轨迹帧生成时构建关于单个-螺旋或-链形成的全局知识。
引用
@article{arxiv.1510.08789,
title = {In-Situ Data Analysis of Protein Folding Trajectories},
author = {Travis Johnston and Boyu Zhang and Adam Liwo and Silvia Crivelli and Michela Taufer},
journal= {arXiv preprint arXiv:1510.08789},
year = {2015}
}
备注
40 pages, 15 figures, this paper is presently in the format request of the journal to which it was submitted for publication