扩散采样的 ART:一种时间步调度的强化学习方法
机器学习
2026-05-11 v2 人工智能
系统与控制
系统与控制
最优化与控制
摘要
我们考虑基于分数的扩散模型的时间离散化,以在有限网格上从学习的逆时动力学中生成样本。在给定时间步数预算的情况下,均匀和手工设计的网格可能是次优的。我们引入了自适应重参数化时间(Adaptive Reparameterized Time, ART),它控制重参数化时间变量的时钟速度,以在保持终止时间的同时沿采样轨迹重新分配计算,目标是最小化累积欧拉离散化误差。我们推导出一个随机伴随方法 ART-RL,将 ART 重新表述为具有高斯策略的连续时间强化学习问题,并证明了两者之间的双向桥梁:确定性的 ART 最优解提升为最优高斯策略,反之,任何最优高斯策略必须通过其均值恢复 ART 控制。这座桥梁将连续时间 actor-critic 学习转化为通往确定性时间步最优解的一条有原则的而非启发式的路径。在官方 EDM 流水线中,ART-RL 在 CIFAR--10 上跨越广泛的预算范围改进了 FID;经过一次性离线训练后,蒸馏的确定性调度无需重新训练即可迁移至 AFHQv2、FFHQ 和 ImageNet,且无额外推理成本。
引用
@article{arxiv.2601.18681,
title = {ART for Diffusion Sampling: A Reinforcement Learning Approach to Timestep Schedule},
author = {Yilie Huang and Wenpin Tang and Xunyu Zhou},
journal= {arXiv preprint arXiv:2601.18681},
year = {2026}
}
备注
25 pages, 8 figures, 5 tables