中文

面向延迟连续控制的 State-Action Inpainting Diffuser

人工智能 2026-03-03 v1 机器学习

摘要

信号延迟是连续控制和强化学习 (RL) 中的根本性挑战,因引入了交互与感知之间的时间差。当前解决方案主要沿着两个 distinct 框架演化:一种是 model-free 方法,利用状态增广来保持马尔可夫特性;另一种是 model-based 方法,专注于通过动态建模推断潜在信念。本文通过引入 State-Action Inpainting Diffuser (SAID),一种将动态学习的归纳偏置与策略优化的直接决策能力相结合的框架,来桥接这两个视角。通过将问题形式化为联合序列填充任务,SAID 隐式地捕获环境动态,同时直接生成一致的计划,有效地在 model-based 和 model-free 框架之间运作。关键的是,这种生成式表述使 SAID 可以无缝应用于在线和离线 RL。广泛的在延迟连续控制基准上的实验表明,SAID 实现了最先进的和稳健的性能。我们的研究表明,这种新方法可以推动 RL with delay 领域的发展。

关键词

引用

@article{arxiv.2603.01553,
  title  = {State-Action Inpainting Diffuser for Continuous Control with Delay},
  author = {Dongqi Han and Wei Wang and Enze Zhang and Dongsheng Li},
  journal= {arXiv preprint arXiv:2603.01553},
  year   = {2026}
}