中文

通过强化学习精炼少步文本到多视图扩散

机器学习 2026-03-18 v2 计算机视觉与模式识别

摘要

文本到多视图(T2MV)扩散模型在从单一文本提示生成场景的多个视图方面展现出了巨大潜力。虽然少步主干网络能够实现实时 T2MV 生成,但它们通常会损害生成质量的关键方面,如单视图保真度和跨视图一致性。强化学习(RL)微调提供了一种潜在的解决方案,但为单图像扩散设计的现有方法不能直接扩展到少步 T2MV 设置,因为它们忽略了跨视图协调,并且在少步机制中学习信号微弱。为了解决这个问题,我们提出了 MVC-ZigAL,一个专为少步 T2MV 扩散模型定制的 RL 微调框架。具体而言,其核心见解是:(1) 一种新的 MDP 公式化,联合建模所有生成的视图,并通过联合视图奖励评估其整体质量;(2) 一种新颖的优势学习策略,利用自精炼采样方案相对于标准采样的性能增益,为有效的 RL 微调产生更强的学习信号;(3) 一个统一的 RL 框架,通过拉格朗日对偶公式扩展优势学习以进行多视图约束优化,在自定步长阈值课程下通过自适应原始-对偶更新平衡单视图和联合视图目标,该课程协调了探索与约束执行。总而言之,这些设计为少步 T2MV 扩散模型实现了稳健且平衡的 RL 微调,在单视图保真度和跨视图一致性方面均取得了显著提升。代码可在 https://github.com/ZiyiZhang27/MVC-ZigAL 获取。

关键词

引用

@article{arxiv.2505.20107,
  title  = {Refining Few-Step Text-to-Multiview Diffusion via Reinforcement Learning},
  author = {Ziyi Zhang and Li Shen and Deheng Ye and Yong Luo and Huangxuan Zhao and Meng Liu and Wei Yu and Lefei Zhang},
  journal= {arXiv preprint arXiv:2505.20107},
  year   = {2026}
}

备注

Accepted to CVPR 2026