中文

基于 Apache Spark 的收敛交叉映射并行化

分布式、并行与集群计算 2019-05-03 v1

摘要

识别主体或变量之间的因果关系仍是各科学领域中的一个重要问题。在涉及人类行为、社会技术背景和自然生态系统等复杂系统中,这一点尤为重要但也极具挑战性。通过利用时间序列的滞后嵌入进行状态空间重构,收敛交叉映射(CCM)成为解决该问题的重要方法。尽管功能强大,CCM 的计算代价高昂;此外,CCM 结果对若干参数值高度敏感。虽然在评估因果关系时最佳实践需要探索一系列参数设置,但由此产生的计算负担会给实际应用带来障碍,尤其是对于呈现弱因果关联的长时间序列。我们在此展示了利用分布式 Apache Spark 平台加速 CCM 的几种方法。我们刻画并报告了若干并行化方案的实验结果,这些方案展现出高度可扩展性,并使基线配置的性能提升超过一个数量级。此类计算时间上的节约可加速复杂系统中因果驱动因素的学习与稳健识别。

关键词

引用

@article{arxiv.1905.00565,
  title  = {Parallelizing Convergent Cross Mapping Using Apache Spark},
  author = {Bo Pu and Lujie Duan and Nathaniel Osgood},
  journal= {arXiv preprint arXiv:1905.00565},
  year   = {2019}
}

备注

11 pages, 5 figures, SBP conference paper