Information Retrieval · Computer Science
Deep Multimodal Image-Text Embeddings for Automatic Cross-Media Retrieval
Hadi Abdi Khojasteh, Ebrahim Ansari, Parvin Razzaghi, Akbar Karimi
2020-02-28
Computer Vision and Pattern Recognition · Computer Science
Seeing Through Words, Speaking Through Pixels: Deep Representational Alignment Between Vision and Language Models
Zoe Wanying He, Sean Trott, Meenakshi Khosla
2025-09-26
Computation and Language · Computer Science
Visually Grounded Word Embeddings and Richer Visual Features for Improving Multimodal Neural Machine Translation
Jean-Benoit Delbrouck, Stéphane Dupont, Omar Seddati
2018-06-01
Computer Vision and Pattern Recognition · Computer Science
Multi-level Multimodal Common Semantic Space for Image-Phrase Grounding
Hassan Akbari, Svebor Karaman, Surabhi Bhargava, Brian Chen +2
2019-05-31
Computer Vision and Pattern Recognition · Computer Science
Jointly Discovering Visual Objects and Spoken Words from Raw Sensory Input
David Harwath, Adrià Recasens, Dídac Surís, Galen Chuang +2
2018-04-05
Computer Vision and Pattern Recognition · Computer Science
Joint Learning of Distributed Representations for Images and Texts
Xiaodong He, Rupesh Srivastava, Jianfeng Gao, Li Deng
2015-04-29
Computer Vision and Pattern Recognition · Computer Science
Finding beans in burgers: Deep semantic-visual embedding with localization
Martin Engilberge, Louis Chevallier, Patrick Pérez, Matthieu Cord
2018-04-09
Computer Vision and Pattern Recognition · Computer Science
Learning to Learn from Web Data through Deep Semantic Embeddings
Raul Gomez, Lluis Gomez, Jaume Gibert, Dimosthenis Karatzas
2018-08-21
Computer Vision and Pattern Recognition · Computer Science
Unsupervised Image Captioning
Yang Feng, Lin Ma, Wei Liu, Jiebo Luo
2019-04-09
Computer Vision and Pattern Recognition · Computer Science
Image Captioning with Deep Bidirectional LSTMs
Cheng Wang, Haojin Yang, Christian Bartz, Christoph Meinel
2016-07-21
Computer Vision and Pattern Recognition · Computer Science
Aligning Linguistic Words and Visual Semantic Units for Image Captioning
Longteng Guo, Jing Liu, Jinhui Tang, Jiangwei Li +2
2019-08-07
Computer Vision and Pattern Recognition · Computer Science
Image search using multilingual texts: a cross-modal learning approach between image and text
Maxime Portaz, Hicham Randrianarivo, Adrien Nivaggioli, Estelle Maudet +2
2019-05-15
Computation and Language · Computer Science
MultiSubs: A Large-scale Multimodal and Multilingual Dataset
Josiah Wang, Pranava Madhyastha, Josiel Figueiredo, Chiraag Lala +1
2022-06-20
Computation and Language · Computer Science
Fine-Grained Grounding for Multimodal Speech Recognition
Tejas Srinivasan, Ramon Sanabria, Florian Metze, Desmond Elliott
2020-10-07
Multimedia · Computer Science
Understanding, Categorizing and Predicting Semantic Image-Text Relations
Christian Otto, Matthias Springstein, Avishek Anand, Ralph Ewerth
2019-06-21
Computer Vision and Pattern Recognition · Computer Science
Fusion Models for Improved Visual Captioning
Marimuthu Kalimuthu, Aditya Mogadala, Marius Mosbach, Dietrich Klakow
2021-03-01
Computer Vision and Pattern Recognition · Computer Science
Multimodal Convolutional Neural Networks for Matching Image and Sentence
Lin Ma, Zhengdong Lu, Lifeng Shang, Hang Li
2015-09-01