Computer Vision and Pattern Recognition · Computer Science
Hi-Light: A Path to high-fidelity, high-resolution video relighting with a Novel Evaluation Paradigm
Xiangrui Liu, Haoxiang Li, Yezhou Yang
2026-02-02
Computer Vision and Pattern Recognition · Computer Science
VideoLights: Feature Refinement and Cross-Task Alignment Transformer for Joint Video Highlight Detection and Moment Retrieval
Dhiman Paul, Md Rizwan Parvez, Nabeel Mohammed, Shafin Rahman
2025-11-25
Computer Vision and Pattern Recognition · Computer Science
Boosting Video-Text Retrieval with Explicit High-Level Semantics
Haoran Wang, Di Xu, Dongliang He, Fu Li +3
2022-08-10
Computer Vision and Pattern Recognition · Computer Science
Listen Then See: Video Alignment with Speaker Attention
Aviral Agrawal, Carlos Mateo Samudio Lezcano, Iqui Balam Heredia-Marin, Prabhdeep Singh Sethi
2024-04-23
Computer Vision and Pattern Recognition · Computer Science
Unified Multimodal Understanding via Byte-Pair Visual Encoding
Wanpeng Zhang, Yicheng Feng, Hao Luo, Yijiang Li +3
2025-07-01
Computer Vision and Pattern Recognition · Computer Science
MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens
Kirolos Ataallah, Xiaoqian Shen, Eslam Abdelrahman, Essam Sleiman +3
2024-04-05
Computer Vision and Pattern Recognition · Computer Science
Video-Teller: Enhancing Cross-Modal Generation with Fusion and Decoupling
Haogeng Liu, Qihang Fan, Tingkai Liu, Linjie Yang +4
2023-10-12
Computer Vision and Pattern Recognition · Computer Science
On Pursuit of Designing Multi-modal Transformer for Video Grounding
Meng Cao, Long Chen, Mike Zheng Shou, Can Zhang +1
2022-04-12
Computer Vision and Pattern Recognition · Computer Science
Re-mine, Learn and Reason: Exploring the Cross-modal Semantic Correlations for Language-guided HOI detection
Yichao Cao, Qingfei Tang, Feng Yang, Xiu Su +3
2023-09-19
Computer Vision and Pattern Recognition · Computer Science
MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues
Yaning Pan, Qianqian Xie, Guohui Zhang, Zekun Wang +12
2026-01-09
Computer Vision and Pattern Recognition · Computer Science
Aligning Subtitles in Sign Language Videos
Hannah Bull, Triantafyllos Afouras, Gül Varol, Samuel Albanie +2
2021-05-07
Computer Vision and Pattern Recognition · Computer Science
Audio-Visual LLM for Video Understanding
Fangxun Shu, Lei Zhang, Hao Jiang, Cihang Xie
2023-12-15
Computer Vision and Pattern Recognition · Computer Science
Enhancing Vision Models for Text-Heavy Content Understanding and Interaction
Adithya TG, Adithya SK, Abhinav R Bharadwaj, Abhiram HA +1
2024-08-31
Computer Vision and Pattern Recognition · Computer Science
ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models
Yongheng Zhang, Xu Liu, Ruihan Tao, Qiguang Chen +3
2025-07-15
Computation and Language · Computer Science
Visual Agreement Regularized Training for Multi-Modal Machine Translation
Pengcheng Yang, Boxing Chen, Pei Zhang, Xu Sun
2019-12-30
Computation and Language · Computer Science
Hierarchical Dialogue Understanding with Special Tokens and Turn-level Attention
Xiao Liu, Jian Zhang, Heng Zhang, Fuzhao Xue +1
2023-05-02
Computer Vision and Pattern Recognition · Computer Science
HiTeA: Hierarchical Temporal-Aware Video-Language Pre-training
Qinghao Ye, Guohai Xu, Ming Yan, Haiyang Xu +3
2023-01-02
Computer Vision and Pattern Recognition · Computer Science
RelightMaster: Precise Video Relighting with Multi-plane Light Images
Weikang Bian, Xiaoyu Shi, Zhaoyang Huang, Jianhong Bai +5
2025-11-11
Computer Vision and Pattern Recognition · Computer Science
MoAlign: Motion-Centric Representation Alignment for Video Diffusion Models
Aritra Bhowmik, Denis Korzhenkov, Cees G. M. Snoek, Amirhossein Habibian +1
2025-10-23
Computer Vision and Pattern Recognition · Computer Science
TubeDETR: Spatio-Temporal Video Grounding with Transformers
Antoine Yang, Antoine Miech, Josef Sivic, Ivan Laptev +1
2022-06-10
Computer Vision and Pattern Recognition · Computer Science
Cross-modal Learning for Multi-modal Video Categorization
Palash Goyal, Saurabh Sahu, Shalini Ghosh, Chul Lee
2020-06-09
Computer Vision and Pattern Recognition · Computer Science
LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer
Yipeng Zhang, Yifan Liu, Zonghao Guo, Yidan Zhang +9
2025-03-20