中文

非平稳任务中的探索与适应:扩散策略方法

人工智能 2025-04-02 v1

摘要

本文探讨了将扩散策略应用于非平稳、基于视觉的强化学习场景,具体针对任务动态和目标随时间演化的环境。我们的工作基于机器人装配线和自主导航等动态真实场景中的实际挑战,代理人必须从高维视觉输入中适应控制策略。我们将扩散策略——一种利用迭代随机去噪来细化潜在动作表示的方法——应用于 Procgen 和 PointMaze 等基准环境。我们的实验表明,尽管计算需求增加,扩散策略始终优于 PPO 和 DQN 等标准强化学习方法,实现更高的平均奖励和最高奖励,并降低了波动性。这些发现凸显了该方法在持续变化条件下生成连贯、情境相关动作序列的能力,同时也指出了在处理极端非平稳性方面仍需进一步改进的空间。

关键词

引用

@article{arxiv.2504.00280,
  title  = {Exploration and Adaptation in Non-Stationary Tasks with Diffusion Policies},
  author = {Gunbir Singh Baveja},
  journal= {arXiv preprint arXiv:2504.00280},
  year   = {2025}
}

备注

7 pages, 1 figure