规模化的视觉桥接转换器
计算机视觉与模式识别
2025-12-01 v1 人工智能
摘要
我们提出了 Vision Bridge Transformer (ViBT),这是一套面向条件生成的 Brownian Bridge 模型的大规模实现。不同于传统扩散模型将噪声转化为数据,Bridge Models 直接建模输入与输出之间的轨迹,创建一种高效的数据到数据翻译范式。通过将这些模型扩展到 20B 和 1.3B 参数,我们展示了其在图像和视频翻译任务中的有效性。为支持此规模,我们采用 Transformer 架构并提出一种方差稳定的 velocity-matching 目标以实现稳健训练。这些进展凸显了在指令式图像编辑和复杂视频翻译中扩展 Bridge Models 的潜力。
关键词
引用
@article{arxiv.2511.23199,
title = {Vision Bridge Transformer at Scale},
author = {Zhenxiong Tan and Zeqing Wang and Xingyi Yang and Songhua Liu and Xinchao Wang},
journal= {arXiv preprint arXiv:2511.23199},
year = {2025}
}