Computation and Language · Computer Science
Nomic Embed: Training a Reproducible Long Context Text Embedder
Zach Nussbaum, John X. Morris, Brandon Duderstadt, Andriy Mulyar
2025-02-05
Computer Vision and Pattern Recognition · Computer Science
VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks
Ziyan Jiang, Rui Meng, Xinyi Yang, Semih Yavuz +2
2025-01-03
Computation and Language · Computer Science
LAMPRET: Layout-Aware Multimodal PreTraining for Document Understanding
Te-Lin Wu, Cheng Li, Mingyang Zhang, Tao Chen +2
2021-04-20
Computation and Language · Computer Science
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
Yifan Dai, Zhenhua Wu, Bohan Zeng, Daili Hua +17
2026-05-22
Computer Vision and Pattern Recognition · Computer Science
NomMer: Nominate Synergistic Context in Vision Transformer for Visual Recognition
Hao Liu, Xinghua Jiang, Xin Li, Zhimin Bao +2
2022-03-15
Computer Vision and Pattern Recognition · Computer Science
UniBind: LLM-Augmented Unified and Balanced Representation Space to Bind Them All
Yuanhuiyi Lyu, Xu Zheng, Jiazhou Zhou, Lin Wang
2024-03-20
Machine Learning · Statistics
Learning Latent Space Energy-Based Prior Model
Bo Pang, Tian Han, Erik Nijkamp, Song-Chun Zhu +1
2020-10-30
Computation and Language · Computer Science
Omni-Embed-Nemotron: A Unified Multimodal Retrieval Model for Text, Image, Audio, and Video
Mengyao Xu, Wenfei Zhou, Yauhen Babakhin, Gabriel Moreira +5
2025-10-07
Computer Vision and Pattern Recognition · Computer Science
Unified Language-Vision Pretraining in LLM with Dynamic Discrete Visual Tokenization
Yang Jin, Kun Xu, Kun Xu, Liwei Chen +12
2024-03-25
Computer Vision and Pattern Recognition · Computer Science
Identity-Aware Textual-Visual Matching with Latent Co-attention
Shuang Li, Tong Xiao, Hongsheng Li, Wei Yang +1
2017-08-08
Computer Vision and Pattern Recognition · Computer Science
ObjEmbed: Towards Universal Multimodal Object Embeddings
Shenghao Fu, Yukun Su, Fengyun Rao, Jing Lyu +2
2026-02-04
Computer Vision and Pattern Recognition · Computer Science
VTok: A Unified Video Tokenizer with Decoupled Spatial-Temporal Latents
Feng Wang, Yichun Shi, Ceyuan Yang, Qiushan Guo +3
2026-02-05
Computer Vision and Pattern Recognition · Computer Science
VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents
Rui Meng, Ziyan Jiang, Ye Liu, Mingyi Su +9
2025-07-08
Computer Vision and Pattern Recognition · Computer Science
Open-Vocabulary Temporal Action Detection with Off-the-Shelf Image-Text Features
Vivek Rathod, Bryan Seybold, Sudheendra Vijayanarasimhan, Austin Myers +3
2023-01-12
Computer Vision and Pattern Recognition · Computer Science
Image search using multilingual texts: a cross-modal learning approach between image and text
Maxime Portaz, Hicham Randrianarivo, Adrien Nivaggioli, Estelle Maudet +2
2019-05-15
Computer Vision and Pattern Recognition · Computer Science
Multi-level Multimodal Common Semantic Space for Image-Phrase Grounding
Hassan Akbari, Svebor Karaman, Surabhi Bhargava, Brian Chen +2
2019-05-31