$Z^2$-采样:语义对齐扩散模型中的零成本锯齿轨迹
计算机视觉与模式识别
2026-04-28 v1
摘要
扩散模型在文本对齐生成中取得了非凡的成功,主要归功于无分类器引导(CFG)。然而,标准CFG仅依据瞬时梯度运作,忽略了数据流形的固有曲率。近期方法如锯齿采样(Z采样)通过显式遍历多步前向-后向轨迹以探测这种曲率,显著提升了语义对齐效果。然而,这些显式遍历会使神经函数评估(NFE)成本翻倍,并引入离流形评估导致的不可约束截断误差,导致与真实边际分布的累积漂移。本文在理论上证明,显式锯齿序列具有可拓扑化简性。我们提出了隐式采样,严格证明中间状态可通过算子对偶性被代数消除,从而物理性地消除离流形近似误差。为将采样效率推至理论下界,我们引入采样(零成本锯齿采样)。利用概率流ODE的时间一致性,采样将隐式代数坍缩与动态缓存的时序语义替代物相结合,恢复标准的2-NFE基准,同时不牺牲语义探索。我们通过反向误差分析形式化证明,这种离散坍缩本质上合成了方向导数曲率惩罚。最终,广泛的评估表明,采样在性能-效率帕累托前沿上实现了结构性突破。我们验证了其在多种架构(U-Net、DiT)和模态(图像、视频)中的通用适用性,确立了与先进对齐框架(AYS、Diffusion-DPO)的无缝正交性。
引用
@article{arxiv.2604.23536,
title = {$Z^2$-Sampling: Zero-Cost Zigzag Trajectories for Semantic Alignment in Diffusion Models},
author = {Haosen Li and Wenshuo Chen and Shaofeng Liang and Lei Wang and Kaishen Yuan and Yutao Yue},
journal= {arXiv preprint arXiv:2604.23536},
year = {2026}
}