中文

规模化的视觉桥接转换器

计算机视觉与模式识别 2025-12-01 v1 人工智能

摘要

我们提出了 Vision Bridge Transformer (ViBT),这是一套面向条件生成的 Brownian Bridge 模型的大规模实现。不同于传统扩散模型将噪声转化为数据,Bridge Models 直接建模输入与输出之间的轨迹,创建一种高效的数据到数据翻译范式。通过将这些模型扩展到 20B 和 1.3B 参数,我们展示了其在图像和视频翻译任务中的有效性。为支持此规模,我们采用 Transformer 架构并提出一种方差稳定的 velocity-matching 目标以实现稳健训练。这些进展凸显了在指令式图像编辑和复杂视频翻译中扩展 Bridge Models 的潜力。

关键词

引用

@article{arxiv.2511.23199,
  title  = {Vision Bridge Transformer at Scale},
  author = {Zhenxiong Tan and Zeqing Wang and Xingyi Yang and Songhua Liu and Xinchao Wang},
  journal= {arXiv preprint arXiv:2511.23199},
  year   = {2025}
}