Visual Bridge:通用视觉感知表征生成
计算机视觉与模式识别
2025-11-12 v1
摘要
扩散模型的最新进展在文本到图像生成、深度估计和光流等独立的计算机视觉任务中取得了显著成功。然而,这些模型通常受限于“单任务-单模型”范式,严重限制了它们在多任务场景中的泛化能力和可扩展性。受大型语言模型跨领域泛化能力的启发,我们提出了一个基于流匹配的通用视觉感知框架,该框架可以跨多个任务生成多样化的视觉表征。我们的方法将该过程形式化为一个从图像块令牌到特定任务表征的通用流匹配问题,而不是一个独立的生成或回归问题。通过利用强大的自监督基础模型作为锚点,并引入多尺度、循环任务嵌入机制,我们的方法学习了一个通用速度场来弥合异构任务之间的差距,支持高效且灵活的表示迁移。在分类、检测、分割、深度估计和图像-文本检索上的大量实验表明,我们的模型在零样本和微调设置下均取得了有竞争力的性能,优于先前的通用模型和几个专用模型。消融研究进一步验证了我们框架的鲁棒性、可扩展性和泛化能力。我们的工作标志着向通用视觉感知迈出了重要一步,为未来通用视觉建模的研究奠定了坚实的基础。
引用
@article{arxiv.2511.07877,
title = {Visual Bridge: Universal Visual Perception Representations Generating},
author = {Yilin Gao and Shuguang Dou and Junzhou Li and Zhiheng Yu and Yin Li and Dongsheng Jiang and Shugong Xu},
journal= {arXiv preprint arXiv:2511.07877},
year = {2025}
}
备注
Accepted by AAAI2026