UniViTAR:面向统一视觉与原生分辨率的 Vision Transformer
计算机视觉与模式识别
2025-05-30 v2
摘要
传统 Vision Transformer 通过标准化输入分辨率简化视觉建模,往往忽视自然视觉数据的变异性,导致时空上下文保真度受损。虽然已有探索表面地尝试原生分辨率建模,但现有方法仍缺乏从视觉表征角度的系统分析。为填补这一空白,我们提出 UniViTAR,一套为多模态时代统一视觉模态与原生分辨率场景量身定制的统一视觉基础模型系列。我们的框架首先通过整合多项先进组件对原始范式进行架构升级。基于这些改进,引入渐进式训练范式,战略性地结合两核心机制:(1)分辨率课程学习,从固定分辨率预训练过渡到原生分辨率调优,充分利用 ViT 对可变长序列的内在适应性;(2)视觉模态适配通过批间图像-视频切换实现,平衡计算效率与时序推理提升。并行地,混合训练框架进一步协同基于 sigmoid 的对比损失与来自冻结教师模型的特征蒸馏,从而加速早期收敛。最终,该模型仅在公开数据集上训练,经 0.3B 至 1B 多种模型规模实验验证其有效性。
关键词
引用
@article{arxiv.2504.01792,
title = {UniViTAR: Unified Vision Transformer with Native Resolution},
author = {Limeng Qiao and Yiyang Gan and Bairui Wang and Jie Qin and Shuang Xu and Siqi Yang and Lin Ma},
journal= {arXiv preprint arXiv:2504.01792},
year = {2025}
}