Computer Vision and Pattern Recognition · Computer Science
Large-scale Self-supervised Video Foundation Model for Intelligent Surgery
Shu Yang, Fengtao Zhou, Leon Mayer, Fuxiang Huang +15
2025-06-04
Computer Vision and Pattern Recognition · Computer Science
LoViT: Long Video Transformer for Surgical Phase Recognition
Yang Liu, Maxence Boels, Luis C. Garcia-Peraza-Herrera, Tom Vercauteren +3
2025-06-06
Computer Vision and Pattern Recognition · Computer Science
ViViT: A Video Vision Transformer
Anurag Arnab, Mostafa Dehghani, Georg Heigold, Chen Sun +2
2021-11-02
Computer Vision and Pattern Recognition · Computer Science
Whether and When does Endoscopy Domain Pretraining Make Sense?
Dominik Batić, Felix Holm, Ege Özsoy, Tobias Czempiel +1
2023-04-03
Computer Vision and Pattern Recognition · Computer Science
MaskViT: Masked Visual Pre-Training for Video Prediction
Agrim Gupta, Stephen Tian, Yunzhi Zhang, Jiajun Wu +2
2022-08-09
Computer Vision and Pattern Recognition · Computer Science
Scaling Video Pretraining for Surgical Foundation Models
Sicheng Lu, Zikai Xiao, Jianhui Wei, Danyu Sun +6
2026-04-03
Robotics · Computer Science
Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation
Hongtao Wu, Ya Jing, Chilam Cheang, Guangzeng Chen +5
2023-12-22
Computer Vision and Pattern Recognition · Computer Science
Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI
Hugo Georgenthum, Cristian Cosentino, Fabrizio Marozzo, Pietro Liò
2025-04-29
Robotics · Computer Science
Large Video Planner Enables Generalizable Robot Control
Boyuan Chen, Tianyuan Zhang, Haoran Geng, Caiyi Zhang +8
2026-05-11
Robotics · Computer Science
ViNT: A Foundation Model for Visual Navigation
Dhruv Shah, Ajay Sridhar, Nitish Dashora, Kyle Stachowicz +3
2023-10-25
Computer Vision and Pattern Recognition · Computer Science
PolyViT: Co-training Vision Transformers on Images, Videos and Audio
Valerii Likhosherstov, Anurag Arnab, Krzysztof Choromanski, Mario Lucic +3
2021-11-29
Computer Vision and Pattern Recognition · Computer Science
A Study of Finetuning Video Transformers for Multi-view Geometry Tasks
Huimin Wu, Kwang-Ting Cheng, Stephen Lin, Zhirong Wu
2025-12-23
Computer Vision and Pattern Recognition · Computer Science
A real-time spatiotemporal AI model analyzes skill in open surgical videos
Emmett D. Goodman, Krishna K. Patel, Yilun Zhang, William Locke +9
2022-01-11
Computer Vision and Pattern Recognition · Computer Science
A generalizable foundation model for intraoperative understanding across surgical procedures
Kanggil Park, Yongjun Jeon, Soyoung Lim, Seonmin Park +8
2026-02-17
Computer Vision and Pattern Recognition · Computer Science
MoViT: Memorizing Vision Transformers for Medical Image Analysis
Yiqing Shen, Pengfei Guo, Jingpu Wu, Qianqi Huang +4
2023-10-03
Image and Video Processing · Electrical Eng. & Systems
GastroViT: A Vision Transformer Based Ensemble Learning Approach for Gastrointestinal Disease Classification with Grad CAM & SHAP Visualization
Sumaiya Tabassum, Md. Faysal Ahamed, Hafsa Binte Kibria, Md. Nahiduzzaman +3
2025-10-01
Computer Vision and Pattern Recognition · Computer Science
VCT: A Video Compression Transformer
Fabian Mentzer, George Toderici, David Minnen, Sung-Jin Hwang +3
2022-10-13
Computer Vision and Pattern Recognition · Computer Science
HSViT: Horizontally Scalable Vision Transformer
Chenhao Xu, Chang-Tsun Li, Chee Peng Lim, Douglas Creighton
2024-07-17
Computer Vision and Pattern Recognition · Computer Science
TerViT: An Efficient Ternary Vision Transformer
Sheng Xu, Yanjing Li, Teli Ma, Bohan Zeng +3
2022-01-24
Computer Vision and Pattern Recognition · Computer Science
MeMViT: Memory-Augmented Multiscale Vision Transformer for Efficient Long-Term Video Recognition
Chao-Yuan Wu, Yanghao Li, Karttikeya Mangalam, Haoqi Fan +3
2022-12-02
Computer Vision and Pattern Recognition · Computer Science
FlexiViT: One Model for All Patch Sizes
Lucas Beyer, Pavel Izmailov, Alexander Kolesnikov, Mathilde Caron +6
2023-03-27
Computer Vision and Pattern Recognition · Computer Science
Isolated Channel Vision Transformers: From Single-Channel Pretraining to Multi-Channel Finetuning
Wenyi Lian, Patrick Micke, Joakim Lindblad, Nataša Sladoje
2025-10-14
Computer Vision and Pattern Recognition · Computer Science
GP-VLS: A general-purpose vision language model for surgery
Samuel Schmidgall, Joseph Cho, Cyril Zakka, William Hiesinger
2024-08-08
Computer Vision and Pattern Recognition · Computer Science
Towards Training Stronger Video Vision Transformers for EPIC-KITCHENS-100 Action Recognition
Ziyuan Huang, Zhiwu Qing, Xiang Wang, Yutong Feng +6
2021-06-10