Computer Vision and Pattern Recognition · Computer Science
ViViT: A Video Vision Transformer
Anurag Arnab, Mostafa Dehghani, Georg Heigold, Chen Sun +2
2021-11-02
Computer Vision and Pattern Recognition · Computer Science
SViTT: Temporal Learning of Sparse Video-Text Transformers
Yi Li, Kyle Min, Subarna Tripathi, Nuno Vasconcelos
2023-04-19
Computer Vision and Pattern Recognition · Computer Science
Video Pre-trained Transformer: A Multimodal Mixture of Pre-trained Experts
Kastan Day, Daniel Christl, Rohan Salvi, Pranav Sriram
2023-04-21
Computer Vision and Pattern Recognition · Computer Science
PolyViT: Co-training Vision Transformers on Images, Videos and Audio
Valerii Likhosherstov, Anurag Arnab, Krzysztof Choromanski, Mario Lucic +3
2021-11-29
Computer Vision and Pattern Recognition · Computer Science
Frozen in Time: A Joint Video and Image Encoder for End-to-End Retrieval
Max Bain, Arsha Nagrani, Gül Varol, Andrew Zisserman
2022-05-16
Computer Vision and Pattern Recognition · Computer Science
UNIT: Unifying Image and Text Recognition in One Vision Encoder
Yi Zhu, Yanpeng Zhou, Chunwei Wang, Yang Cao +3
2024-09-09
Computer Vision and Pattern Recognition · Computer Science
Chasing Sparsity in Vision Transformers: An End-to-End Exploration
Tianlong Chen, Yu Cheng, Zhe Gan, Lu Yuan +2
2021-10-26
Computer Vision and Pattern Recognition · Computer Science
Mobile V-MoEs: Scaling Down Vision Transformers via Sparse Mixture-of-Experts
Erik Daxberger, Floris Weers, Bowen Zhang, Tom Gunter +6
2023-09-11
Computer Vision and Pattern Recognition · Computer Science
VidEoMT: Your ViT is Secretly Also a Video Segmentation Model
Narges Norouzi, Idil Esen Zulfikar, Niccolò Cavagnero, Tommie Kerssies +3
2026-03-05
Computer Vision and Pattern Recognition · Computer Science
Sparse in Space and Time: Audio-visual Synchronisation with Trainable Selectors
Vladimir Iashin, Weidi Xie, Esa Rahtu, Andrew Zisserman
2022-10-14
Computer Vision and Pattern Recognition · Computer Science
Sub-token ViT Embedding via Stochastic Resonance Transformers
Dong Lao, Yangchao Wu, Tian Yu Liu, Alex Wong +1
2024-05-08
Computer Vision and Pattern Recognition · Computer Science
Make A Long Image Short: Adaptive Token Length for Vision Transformers
Yichen Zhu, Yuqin Zhu, Jie Du, Yi Wang +3
2021-12-07
Computer Vision and Pattern Recognition · Computer Science
Your ViT is Secretly an Image Segmentation Model
Tommie Kerssies, Niccolò Cavagnero, Alexander Hermans, Narges Norouzi +4
2025-03-26
Computer Vision and Pattern Recognition · Computer Science
AdaptFormer: Adapting Vision Transformers for Scalable Visual Recognition
Shoufa Chen, Chongjian Ge, Zhan Tong, Jiangliu Wang +3
2022-10-18
Computer Vision and Pattern Recognition · Computer Science
VCT: A Video Compression Transformer
Fabian Mentzer, George Toderici, David Minnen, Sung-Jin Hwang +3
2022-10-13
Computer Vision and Pattern Recognition · Computer Science
Limited Data, Unlimited Potential: A Study on ViTs Augmented by Masked Autoencoders
Srijan Das, Tanmay Jain, Dominick Reilly, Pranav Balaji +5
2023-12-29
Computer Vision and Pattern Recognition · Computer Science
Image and Model Transformation with Secret Key for Vision Transformer
Hitoshi Kiya, Ryota Iijima, MaungMaung Aprilpyone, Yuma Kinoshita
2023-01-11
Computer Vision and Pattern Recognition · Computer Science
Slicing Vision Transformer for Flexible Inference
Yitian Zhang, Huseyin Coskun, Xu Ma, Huan Wang +5
2024-12-09