Computer Vision and Pattern Recognition · Computer Science
Cross-Domain First Person Audio-Visual Action Recognition through Relative Norm Alignment
Mirco Planamente, Chiara Plizzari, Emanuele Alberti, Barbara Caputo
2021-06-04
Computer Vision and Pattern Recognition · Computer Science
Audio-Adaptive Activity Recognition Across Video Domains
Yunhua Zhang, Hazel Doughty, Ling Shao, Cees G. M. Snoek
2022-03-30
Computer Vision and Pattern Recognition · Computer Science
Domain Generalization through Audio-Visual Relative Norm Alignment in First Person Action Recognition
Mirco Planamente, Chiara Plizzari, Emanuele Alberti, Barbara Caputo
2022-04-21
Computer Vision and Pattern Recognition · Computer Science
AUD-TGN: Advancing Action Unit Detection with Temporal Convolution and GPT-2 in Wild Audiovisual Contexts
Jun Yu, Zerui Zhang, Zhihong Wei, Gongpeng Zhao +5
2024-03-21
Computer Vision and Pattern Recognition · Computer Science
Domain Generalization for Improved Human Activity Recognition in Office Space Videos Using Adaptive Pre-processing
Partho Ghosh, Raisa Bentay Hossain, Mohammad Zunaed, Taufiq Hasan
2025-03-18
Computer Vision and Pattern Recognition · Computer Science
INDIGO: Intrinsic Multimodality for Domain Generalization
Puneet Mangla, Shivam Chandhok, Milan Aggarwal, Vineeth N Balasubramanian +1
2022-06-14
Machine Learning · Computer Science
Towards disentangling the contributions of articulation and acoustics in multimodal phoneme recognition
Sean Foley, Hong Nguyen, Jihwan Lee, Sudarsana Reddy Kadiri +3
2025-06-02
Audio and Speech Processing · Electrical Eng. & Systems
Towards General Auditory Intelligence: Large Multimodal Models for Machine Listening and Speaking
Siyin Wang, Zengrui Jin, Changli Tang, Qiujia Li +25
2025-11-04
Computer Vision and Pattern Recognition · Computer Science
Advances in Multimodal Adaptation and Generalization: From Traditional Approaches to Foundation Models
Hao Dong, Moru Liu, Kaiyang Zhou, Eleni Chatzi +3
2025-09-22
Computation and Language · Computer Science
Learning Domain Knowledge in Multimodal Large Language Models through Reinforcement Fine-Tuning
Qinglong Cao, Yuntian Chen, Chao Ma, Xiaokang Yang
2026-02-05
Computation and Language · Computer Science
A Study of Enhancement, Augmentation, and Autoencoder Methods for Domain Adaptation in Distant Speech Recognition
Hao Tang, Wei-Ning Hsu, Francois Grondin, James Glass
2018-06-14
Computer Vision and Pattern Recognition · Computer Science
Deep Multimodal Fusion for Generalizable Person Re-identification
Suncheng Xiang, Hao Chen, Wei Ran, Zefang Yu +3
2023-01-02
Machine Learning · Computer Science
Attribution Regularization for Multimodal Paradigms
Sahiti Yerramilli, Jayant Sravan Tamarapalli, Jonathan Francis, Eric Nyberg
2025-09-12
Computer Vision and Pattern Recognition · Computer Science
MAiVAR-T: Multimodal Audio-image and Video Action Recognizer using Transformers
Muhammad Bilal Shaikh, Douglas Chai, Syed Mohammed Shamsul Islam, Naveed Akhtar
2023-08-08
Computation and Language · Computer Science
Fine-Grained Grounding for Multimodal Speech Recognition
Tejas Srinivasan, Ramon Sanabria, Florian Metze, Desmond Elliott
2020-10-07
Machine Learning · Computer Science
Integrating Audio, Visual, and Semantic Information for Enhanced Multimodal Speaker Diarization
Luyao Cheng, Hui Wang, Siqi Zheng, Yafeng Chen +4
2024-08-23
Computer Vision and Pattern Recognition · Computer Science
Domain Generalization for Activity Recognition via Adaptive Feature Fusion
Xin Qin, Jindong Wang, Yiqiang Chen, Wang Lu +1
2022-07-25
Computer Vision and Pattern Recognition · Computer Science
Learning Semantic Directions for Feature Augmentation in Domain-Generalized Medical Segmentation
Yingkai Wang, Yaoyao Zhu, Xiuding Cai, Yuhao Xiao +2
2025-08-01