中文

NoiseGate:基于信息门控的世界动作模型中可学习的逐时步调度

机器人学 2026-05-11 v1

摘要

世界动作模型(World Action Models,WAMs)是一类将机器人动作生成与未来观察建模相结合的策略。在本工作中,我们聚焦于联合视频-动作建模范式,其中动作与想象的未来观察沿共享的去噪或流轨迹共生成,以实现感知、预测和控制在单一生成过程中的耦合。现有WAMs通常通过混合Transformer(Mixture-of-Transformers,MoT)实现该范式,视频和动作token通过共享自注意力相互作用。该架构在原理上可以为每个预测潜在帧分配独立的时步tft_f,但当前系统将这一自由度简化为单个共享标量tt。在扩散强制(Diffusion Forcing)的噪声即遮蔽观点下,该共享调度假设每个预测潜位都 equally 可靠以生成动作,这是不合理的。我们则将逐潜位调度视为可学习的信息门控策略:通过改变潜位帧的噪声水平,策略调制其对动作token的Key/Value贡献可靠性。我们提出了NoiseGate,其组合了在主干网络训练期间的独立逐潜位时步抽样、轻量级门控策略网络(Gating Policy Network)在去噪期间发出逐潜位时步增量,以及无需手工形状先验的任务奖励优化。基于联合视频-动作MoT主干,NoiseGate在多样化的RoboTwin随机场景操控任务上实现了一致的性能提升。

关键词

引用

@article{arxiv.2605.07794,
  title  = {NoiseGate: Learning Per-Latent Timestep Schedules as Information Gating in World Action Models},
  author = {Wen Huang and Haoran Sun and Yongjian Guo and Yunxuan Ma and Haoran Li and Jing Long and Zhouying Mo and Zhong Guan and Yucheng Guo and Shuai Di and Junwu Xiong},
  journal= {arXiv preprint arXiv:2605.07794},
  year   = {2026}
}