掩码自回归变分加速:快速推断让强化学习实用化
机器学习
2026-03-18 v3 人工智能
摘要
掩码自回归扩散模型(MAR)受益于扩散模型的表征建模能力以及掩码自回归排序的灵活性。然而,原始MAR因其层次化推理机制(外层AR解掩码循环与内层扩散去噪链)而导致推理速度慢。这种解耦结构不仅损害生成效率,还阻碍了MAR在强化学习(RL)中的实际应用——这是生成模型后训练中日益关键的范式。为解决这一根本问题,本文引入MARVAL(Masked Auto-regressive Variational Acceleration),这是一种基于蒸馏的框架,将扩散链压缩为单个自回归生成步骤,同时保留灵活的自回归解掩码顺序。这种蒸馏不仅显著加速推理,关键在于使MAR能够进行带可验证奖励的RL后训练,最终实现可扩展且人类更青睐的快速生成模型。我们的贡献有两方面:(1)一种新颖的基于得分的变分目标,用于在不牺牲样本质量的前提下将掩码自回归扩散模型蒸馏为单个生成步骤;(2)基于MARVAL的高效RL框架。在ImageNet 256×256上,MARVAL-Huge实现FID为2.00,相较于MAR-diffusion快逾30倍;MARVAL-RL在ImageNet数据集上在CLIP和图像奖励分数上均实现持续提升。总体而言,MARVAL首次为掩码自回归扩散模型的蒸馏与RL提供了实际可行的路径,实现快速采样与更好的偏好对齐。
引用
@article{arxiv.2511.15190,
title = {Masked Auto-Regressive Variational Acceleration: Fast Inference Makes Practical Reinforcement Learning},
author = {Yuxuan Gu and Weimin Bai and Yifei Wang and Weijian Luo and He Sun},
journal= {arXiv preprint arXiv:2511.15190},
year = {2026}
}