用于预测大数据传输的回归技术
分布式、并行与集群计算
2007-05-23 v1
摘要
数据网格的近期普及以及日益常见的将资源用作分布式数据存储的做法,为科研人员共享、复制和管理大型数据集副本提供了便利。这引出了一个问题:哪个副本可以被最高效地访问?在此类环境中,获取可能的源位置中的数据需要对端到端传输时间进行准确预测。这个问题的答案取决于许多因素,包括资源的物理特征以及CPU、网络和存储设备在连接可能的源点和终点的端到端数据路径中所承担的负载行为。我们的 метод结合了端到端应用吞吐量观察与网络和磁盘负载变化,捕捉整个系统的性能及其负载模式变化。我们的预测刻画了多个共享设备(网络和磁盘)对文件传输时间影响的模式。我们开发了一套单变量和多变量预测器,可以使用多个数据源来提高预测准确性,同时应对数据网格的变化(数据可用性和传输的零星性)。我们使用GridFTP运行了大量数据传输实验,在测试场所实现了约15%的误差,这在实际系统中相当有前景。
引用
@article{arxiv.cs/0304037,
title = {Using Regression Techniques to Predict Large Data Transfers},
author = {Sudharshan Vazhkudai and Jennifer M. Schopf},
journal= {arXiv preprint arXiv:cs/0304037},
year = {2007}
}
备注
29 pages, 11 figures