Computer Vision and Pattern Recognition · Computer Science
UMT: Unified Multi-modal Transformers for Joint Video Moment Retrieval and Highlight Detection
Ye Liu, Siyuan Li, Yang Wu, Chang Wen Chen +2
2022-03-29
Computation and Language · Computer Science
MMOU: A Massive Multi-Task Omni Understanding and Reasoning Benchmark for Long and Complex Real-World Videos
Arushi Goel, Sreyan Ghosh, Vatsal Agarwal, Nishit Anand +15
2026-03-17
Computation and Language · Computer Science
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
Yifan Dai, Zhenhua Wu, Bohan Zeng, Daili Hua +17
2026-05-22
Computer Vision and Pattern Recognition · Computer Science
U-Mind: A Unified Framework for Real-Time Multimodal Interaction with Audiovisual Generation
Xiang Deng, Feng Gao, Yong Zhang, Youxin Pang +4
2026-03-02
Computer Vision and Pattern Recognition · Computer Science
UnIVAL: Unified Model for Image, Video, Audio and Language Tasks
Mustafa Shukor, Corentin Dancette, Alexandre Rame, Matthieu Cord
2023-12-25
Computer Vision and Pattern Recognition · Computer Science
Everything is a Video: Unifying Modalities through Next-Frame Prediction
G. Thomas Hudson, Dean Slack, Thomas Winterbottom, Jamie Sterling +3
2025-07-29
Computation and Language · Computer Science
Watch, Listen, and Describe: Globally and Locally Aligned Cross-Modal Attentions for Video Captioning
Xin Wang, Yuan-Fang Wang, William Yang Wang
2018-04-17
Computer Vision and Pattern Recognition · Computer Science
LatentUM: Unleashing the Potential of Interleaved Cross-Modal Reasoning via a Latent-Space Unified Model
Jiachun Jin, Zetong Zhou, Xiao Yang, Hao Zhang +3
2026-04-03
Computer Vision and Pattern Recognition · Computer Science
Watch, Listen and Tell: Multi-modal Weakly Supervised Dense Event Captioning
Tanzila Rahman, Bicheng Xu, Leonid Sigal
2019-10-28
Computer Vision and Pattern Recognition · Computer Science
Referred by Multi-Modality: A Unified Temporal Transformer for Video Object Segmentation
Shilin Yan, Renrui Zhang, Ziyu Guo, Wenchao Chen +6
2023-12-13
Computation and Language · Computer Science
Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration
Chenyang Lyu, Minghao Wu, Longyue Wang, Xinting Huang +4
2023-06-16
Machine Learning · Computer Science
Text-centric Alignment for Multi-Modality Learning
Yun-Da Tsai, Ting-Yu Yen, Pei-Fu Guo, Zhe-Yan Li +1
2024-05-22
Artificial Intelligence · Computer Science
Agent-Omni: Test-Time Multimodal Reasoning via Model Coordination for Understanding Anything
Huawei Lin, Yunzhi Shi, Tong Geng, Weijie Zhao +2
2025-11-06
Machine Learning · Computer Science
AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
Seungwhan Moon, Andrea Madotto, Zhaojiang Lin, Tushar Nagarajan +9
2023-09-29
Computer Vision and Pattern Recognition · Computer Science
Enhancing Video Large Language Models with Structured Multi-Video Collaborative Reasoning
Zhihao He, Tianyao He, Yun Xu, Tieyuan Chen +4
2025-11-21
Computer Vision and Pattern Recognition · Computer Science
LEMON: How Well Do MLLMs Perform Temporal Multimodal Understanding on Instructional Videos?
Zhuang Yu, Lei Shen, Jing Zhao, Shiliang Sun
2026-01-29
Computer Vision and Pattern Recognition · Computer Science
Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional Tokenization
Yang Jin, Zhicheng Sun, Kun Xu, Kun Xu +9
2024-06-04
Computer Vision and Pattern Recognition · Computer Science
UniT: Unified Multimodal Chain-of-Thought Test-time Scaling
Leon Liangyu Chen, Haoyu Ma, Zhipeng Fan, Ziqi Huang +10
2026-02-13