Computer Vision and Pattern Recognition · Computer Science
Mimir: Improving Video Diffusion Models for Precise Text Understanding
Shuai Tan, Biao Gong, Yutong Feng, Kecheng Zheng +5
2024-12-05
Computer Vision and Pattern Recognition · Computer Science
MOVi: Training-free Text-conditioned Multi-Object Video Generation
Aimon Rahman, Jiang Liu, Ze Wang, Ximeng Sun +6
2025-05-30
Machine Learning · Computer Science
TV2TV: A Unified Framework for Interleaved Language and Video Generation
Xiaochuang Han, Youssef Emad, Melissa Hall, John Nguyen +14
2025-12-15
Computer Vision and Pattern Recognition · Computer Science
LLM-grounded Video Diffusion Models
Long Lian, Baifeng Shi, Adam Yala, Trevor Darrell +1
2024-05-07
Computer Vision and Pattern Recognition · Computer Science
VideoDirectorGPT: Consistent Multi-scene Video Generation via LLM-Guided Planning
Han Lin, Abhay Zala, Jaemin Cho, Mohit Bansal
2024-07-16
Computer Vision and Pattern Recognition · Computer Science
Vision-Language-Vision Auto-Encoder: Scalable Knowledge Distillation from Diffusion Models
Tiezheng Zhang, Yitong Li, Yu-cheng Chou, Jieneng Chen +3
2025-07-14
Computer Vision and Pattern Recognition · Computer Science
PolySmart @ TRECVid 2024 Video Captioning (VTT)
Jiaxin Wu, Wengyu Zhang, Xiao-Yong Wei, Qing Li
2025-01-28
Computer Vision and Pattern Recognition · Computer Science
LMGenDrive: Bridging Multimodal Understanding and Generative World Modeling for End-to-End Driving
Hao Shao, Letian Wang, Yang Zhou, Yuxuan Hu +4
2026-04-13
Computer Vision and Pattern Recognition · Computer Science
Exploring Pre-trained Text-to-Video Diffusion Models for Referring Video Object Segmentation
Zixin Zhu, Xuelu Feng, Dongdong Chen, Junsong Yuan +2
2024-07-09
Computer Vision and Pattern Recognition · Computer Science
MoTrans: Customized Motion Transfer with Text-driven Video Diffusion Models
Xiaomin Li, Xu Jia, Qinghe Wang, Haiwen Diao +4
2024-12-03
Computer Vision and Pattern Recognition · Computer Science
PhyT2V: LLM-Guided Iterative Self-Refinement for Physics-Grounded Text-to-Video Generation
Qiyao Xue, Xiangyu Yin, Boyuan Yang, Wei Gao
2025-04-02
Computer Vision and Pattern Recognition · Computer Science
VLTinT: Visual-Linguistic Transformer-in-Transformer for Coherent Video Paragraph Captioning
Kashu Yamazaki, Khoa Vo, Sang Truong, Bhiksha Raj +1
2023-02-17
Computer Vision and Pattern Recognition · Computer Science
LuciBot: Automated Robot Policy Learning from Generated Videos
Xiaowen Qiu, Yian Wang, Jiting Cai, Zhehuan Chen +3
2025-03-14
Computer Vision and Pattern Recognition · Computer Science
Understanding Long Videos with Multimodal Language Models
Kanchana Ranasinghe, Xiang Li, Kumara Kahatapitiya, Michael S. Ryoo
2025-06-12
Computer Vision and Pattern Recognition · Computer Science
LinVT: Empower Your Image-level Large Language Model to Understand Videos
Lishuai Gao, Yujie Zhong, Yingsen Zeng, Haoxian Tan +2
2024-12-12
Computer Vision and Pattern Recognition · Computer Science
Rethinking Video-Language Model from the Language Input Perspective
Xiang Fang, Wanlong Fang, Changshuo Wang, Xiaoye Qu +1
2026-05-28
Computer Vision and Pattern Recognition · Computer Science
Vamos: Versatile Action Models for Video Understanding
Shijie Wang, Qi Zhao, Minh Quan Do, Nakul Agarwal +2
2024-07-16
Computer Vision and Pattern Recognition · Computer Science
DirecT2V: Large Language Models are Frame-Level Directors for Zero-Shot Text-to-Video Generation
Susung Hong, Junyoung Seo, Heeseong Shin, Sunghwan Hong +1
2024-02-07
Computer Vision and Pattern Recognition · Computer Science
V2V-LLM: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multimodal Large Language Models
Hsu-kuang Chiu, Ryo Hachiuma, Chien-Yi Wang, Stephen F. Smith +2
2026-02-17
Computer Vision and Pattern Recognition · Computer Science
Eliciting In-Context Learning in Vision-Language Models for Videos Through Curated Data Distributional Properties
Keunwoo Peter Yu, Zheyuan Zhang, Fengyuan Hu, Shane Storks +1
2024-10-04
Computer Vision and Pattern Recognition · Computer Science
Learning from Videos for 3D World: Enhancing MLLMs with 3D Vision Geometry Priors
Duo Zheng, Shijia Huang, Yanyang Li, Liwei Wang
2025-10-23
Computer Vision and Pattern Recognition · Computer Science
Reading Images Like Texts: Sequential Image Understanding in Vision-Language Models
Yueyan Li, Chenggong Zhao, Zeyuan Zang, Caixia Yuan +1
2026-02-10