中文

LAVA:基于学习分布与预测误差适应的生命周期感知虚拟机分配

分布式、并行与集群计算 2025-06-05 v2

摘要

在云数据中心中将虚拟机(VM)调度到主机上决定了效率,且是一个信息不完备的NP难问题。此前的工作通过预测VM生命周期来改进VM调度。我们的工作进一步通过重预测与生命周期分布(而非一次性预测)改进了生命周期感知调度。当出现错误预测时,我们的方法会重预测并调整VM和主机的生命周期。我们还提出了碎片整理和定期系统维护的新方法,这些对数据中心的可靠性和优化至关重要,但此前的研究尚未涉及。我们表明重预测在有效性方面相较于一次性预测取得了根本性提升。我们将基于分布的生命周期预测与调度算法的结合称为生命周期感知虚拟机分配(LAVA)。LAVA减少了资源闲置,增加了空主机的数量,这对大型VM调度、云系统更新和降低动态能耗至关重要。我们的方法在Google的超大规模云数据中心中投入生产运行,通过减少约3%和约2%的闲置计算和内存资源来提高效率。它在生产中使空主机数量增加2.3-9.2个百分点,降低了动态能耗,并提高了大型VM和云系统更新的可用性。我们还表明减少了用于主机碎片整理和维护的VM迁移。除了全集群生产部署外,我们还进行了仿真研究以刻画设计空间,并表明我们的算法显著优于此前基于生命周期的调度方法。

关键词

引用

@article{arxiv.2412.09840,
  title  = {LAVA: Lifetime-Aware VM Allocation with Learned Distributions and Adaptation to Mispredictions},
  author = {Jianheng Ling and Pratik Worah and Yawen Wang and Yunchuan Kong and Anshul Kapoor and Chunlei Wang and Clifford Stein and Diwakar Gupta and Jason Behmer and Logan A. Bush and Prakash Ramanan and Rajesh Kumar and Thomas Chestna and Yajing Liu and Ying Liu and Ye Zhao and Kathryn S. McKinley and Meeyoung Park and Martin Maas},
  journal= {arXiv preprint arXiv:2412.09840},
  year   = {2025}
}