Xray-Visual 模型:在行业规模数据上的视觉模型扩展
计算机视觉与模式识别
2026-02-20 v1 人工智能
摘要
我们提出Xray-Visual,一个用于大规模图像和视频理解的统一视觉模型架构,训练于来自Facebook和Instagram的行业规模社交媒体数据。该模型利用超过150亿张精选图像-文本对和100亿条视频-标签对,采用稳健的数据 curated 流程,集成平衡和噪声抑制策略,以最大化语义多样性同时最小化标签噪声。我们引入三阶段训练流程,结合自监督MAE、半监督标签分类和CLIP风格对比学习,联合优化图像和视频两种模态。模型架构基于Vision Transformer骨架,增强了高效token重组织(EViT),以提高计算效率。广泛实验表明,Xray-Visual在ImageNet图像分类、Kinetics和HMDB51视频理解、MSCOCO跨模态检索等多样化基准上实现了最佳性能,表现出对领域迁移和对抗性扰动的强鲁棒性。我们进一步演示,将大型语言模型作为文本编码器(LLM2CLIP)显著提升检索性能和泛化能力,尤其在真实世界环境中效果显著。Xray-Visual为可扩展、多模态视觉模型树立了新基准,同时保持卓越的准确率和计算效率。
引用
@article{arxiv.2602.16918,
title = {Xray-Visual Models: Scaling Vision models on Industry Scale Data},
author = {Shlok Mishra and Tsung-Yu Lin and Linda Wang and Hongli Xu and Yimin Liu and Michael Hsu and Chaitanya Ahuja and Hao Yuan and Jianpeng Cheng and Hong-You Chen and Haoyuan Xu and Chao Li and Abhijeet Awasthi and Jihye Moon and Don Husa and Michael Ge and Sumedha Singla and Arkabandhu Chowdhury and Phong Dingh and Satya Narayan Shukla and Yonghuan Yang and David Jacobs and Qi Guo and Jun Xiao and Xiangjun Fan and Aashu Singh},
journal= {arXiv preprint arXiv:2602.16918},
year = {2026}
}