Computer Vision and Pattern Recognition · Computer Science
LidarCLIP or: How I Learned to Talk to Point Clouds
Georg Hess, Adam Tonderski, Christoffer Petersson, Kalle Åström +1
2023-05-03
Audio and Speech Processing · Electrical Eng. & Systems
Timbre-Trap: A Low-Resource Framework for Instrument-Agnostic Music Transcription
Frank Cwitkowitz, Kin Wai Cheuk, Woosung Choi, Marco A. Martínez-Ramírez +3
2024-01-25
Audio and Speech Processing · Electrical Eng. & Systems
Leveraging Pretrained Image-text Models for Improving Audio-Visual Learning
Saurabhchand Bhati, Jesús Villalba, Laureano Moro-Velazquez, Thomas Thebaud +1
2023-09-12
Computer Vision and Pattern Recognition · Computer Science
Learning Audio-Video Modalities from Image Captions
Arsha Nagrani, Paul Hongsuck Seo, Bryan Seybold, Anja Hauth +3
2022-04-05
Machine Learning · Computer Science
Synergy-CLIP: Extending CLIP with Multi-modal Integration for Robust Representation Learning
Sangyeon Cho, Jangyeong Jeon, Mingi Kim, Junyeong Kim
2025-05-01
Computer Vision and Pattern Recognition · Computer Science
Learning complete and explainable visual representations from itemized text supervision
Yiwei Lyu, Chenhui Zhao, Soumyanil Banerjee, Shixuan Liu +4
2026-03-18
Computer Vision and Pattern Recognition · Computer Science
VT-CLIP: Enhancing Vision-Language Models with Visual-guided Texts
Longtian Qiu, Renrui Zhang, Ziyu Guo, Ziyao Zeng +3
2023-08-11
Computer Vision and Pattern Recognition · Computer Science
Transcription-Enriched Joint Embeddings for Spoken Descriptions of Images and Videos
Benet Oriol, Jordi Luque, Ferran Diego, Xavier Giro-i-Nieto
2020-06-02
Computation and Language · Computer Science
SpeechCLIP: Integrating Speech with Pre-Trained Vision and Language Model
Yi-Jen Shih, Hsuan-Fu Wang, Heng-Jui Chang, Layne Berry +2
2022-10-26
Computer Vision and Pattern Recognition · Computer Science
EditCLIP: Representation Learning for Image Editing
Qian Wang, Aleksandar Cvejic, Abdelrahman Eldesokey, Peter Wonka
2025-03-27
Multimedia · Computer Science
Intelligent Text-Conditioned Music Generation
Zhouyao Xie, Nikhil Yadala, Xinyi Chen, Jing Xi Liu
2024-06-04
Computation and Language · Computer Science
EfficientCLIP: Efficient Cross-Modal Pre-training by Ensemble Confident Learning and Language Modeling
Jue Wang, Haofan Wang, Jincan Deng, Weijia Wu +1
2021-09-23
Computer Vision and Pattern Recognition · Computer Science
MARBLE: Material Recomposition and Blending in CLIP-Space
Ta-Ying Cheng, Prafull Sharma, Mark Boss, Varun Jampani
2025-06-06
Audio and Speech Processing · Electrical Eng. & Systems
Text2FX: Harnessing CLAP Embeddings for Text-Guided Audio Effects
Annie Chu, Patrick O'Reilly, Julia Barnett, Bryan Pardo
2025-02-21