中文

游戏实时扩散策略:利用Q集成增强一致性策略

人工智能 2025-03-24 v1

摘要

扩散模型在捕捉游戏智能体的复杂多模态动作分布方面表现出色,但其缓慢的推理速度阻碍了在实时游戏环境中的实际部署。虽然一致性模型为一步生成提供了一种有前景的方法,但在应用于策略学习时,它们常常面临训练不稳定和性能退化的问题。在本文中,我们提出了CPQE(带Q集成的一致性策略),它将一致性模型与Q集成相结合以应对这些挑战。CPQE通过Q集成利用不确定性估计提供更可靠的价值函数近似,与经典的双Q网络方法相比,实现了更好的训练稳定性和改进的性能。我们在多个游戏场景中的大量实验表明,CPQE实现了高达60 Hz的推理速度——相比仅以20 Hz运行的最先进扩散策略有显著提升——同时保持与多步扩散方法相当的性能。CPQE始终优于最先进的一致性模型方法,在整个学习过程中展现出更高的奖励和增强的训练稳定性。这些结果表明,CPQE为在游戏和其他实时应用中部署基于扩散的策略提供了实用解决方案,其中多模态行为建模和快速推理都是关键要求。

关键词

引用

@article{arxiv.2503.16978,
  title  = {Real-Time Diffusion Policies for Games: Enhancing Consistency Policies with Q-Ensembles},
  author = {Ruoqi Zhang and Ziwei Luo and Jens Sjölund and Per Mattsson and Linus Gisslén and Alessandro Sestini},
  journal= {arXiv preprint arXiv:2503.16978},
  year   = {2025}
}