中文

基于轨迹冲突导航的Waypoint扩散Transformer(WiT)

计算机视觉与模式识别 2026-03-27 v2

摘要

虽然最近的Flow Matching模型通过直接在像素空间操作,避免了潜在自编码器的重建瓶颈,但缺乏语义连续性的像素流形严重交织了最优传输路径。这导致在交叉点附近出现严重的轨迹冲突,产生亚最优解。与通过信息损失的潜在表示规避此问题不同,我们直接通过提出Waypoint扩散Transformer(WiT)来解缠像素空间的轨迹。WiT通过从预训练视觉模型投影的中间语义路标来因子化连续向量场。它有效地通过将最优传输分为先于路标到路标之间和路标到像素之间的两个段,来解缠生成轨迹。具体而言,在迭代去噪过程中,一个轻量级生成器会从当前噪声状态动态推断这些中间路标。它们随后通过Just-Pixel AdaLN机制持续地对主要扩散Transformer进行条件化,以引导演化朝向下一个状态,最终产生最终的RGB像素。在ImageNet 256x256上评估的WiT超过了强大的像素空间基线,加快了JiT训练收敛速度2.2倍。代码将在https://github.com/hainuo-wang/WiT.git公开。

关键词

引用

@article{arxiv.2603.15132,
  title  = {WiT: Waypoint Diffusion Transformers via Trajectory Conflict Navigation},
  author = {Hainuo Wang and Mingjia Li and Xiaojie Guo},
  journal= {arXiv preprint arXiv:2603.15132},
  year   = {2026}
}