等变扩散策略的对称感知引导:优势与局限
机器学习
2025-12-15 v1 机器人学
摘要
等变扩散策略(EDPs)将扩散模型的生成表达能力与几何对称性提供的强泛化性和样本效率相结合。虽然利用强化学习(RL)引导这些策略为超越演示数据的微调提供了有前景的机制,但直接应用标准(非等变)RL会导致样本效率低下且不稳定,因为它忽略了EDP旨在利用的对称性。在本文中,我们从理论上证明了EDP的扩散过程是等变的,这进而诱导了一个群不变潜噪声MDP,适合进行等变扩散引导。基于该理论,我们引入了一个系统的对称感知引导框架,并通过具有不同程度对称性的任务进行了全面实验,比较了标准、等变和近似等变RL策略。虽然我们识别了严格等变性在对称性破缺下的实际边界,但我们证明在引导过程中利用对称性可带来显著优势——增强样本效率、防止价值发散,并在EDP仅从极有限演示中训练时仍实现强策略提升。
引用
@article{arxiv.2512.11345,
title = {Symmetry-Aware Steering of Equivariant Diffusion Policies: Benefits and Limits},
author = {Minwoo Park and Junwoo Chang and Jongeun Choi and Roberto Horowitz},
journal= {arXiv preprint arXiv:2512.11345},
year = {2025}
}