Computer Vision and Pattern Recognition · Computer Science
AVATAR: Unconstrained Audiovisual Speech Recognition
Valentin Gabeur, Paul Hongsuck Seo, Arsha Nagrani, Chen Sun +2
2022-06-16
Computer Vision and Pattern Recognition · Computer Science
QuAVF: Quality-aware Audio-Visual Fusion for Ego4D Talking to Me Challenge
Hsi-Che Lin, Chien-Yi Wang, Min-Hung Chen, Szu-Wei Fu +1
2023-07-03
Audio and Speech Processing · Electrical Eng. & Systems
Multiresolution and Multimodal Speech Recognition with Transformers
Georgios Paraskevopoulos, Srinivas Parthasarathy, Aparna Khare, Shiva Sundaram
2020-05-01
Computer Vision and Pattern Recognition · Computer Science
Egocentric Video Task Translation @ Ego4D Challenge 2022
Zihui Xue, Yale Song, Kristen Grauman, Lorenzo Torresani
2023-02-06
Computer Vision and Pattern Recognition · Computer Science
Action Sensitivity Learning for the Ego4D Episodic Memory Challenge 2023
Jiayi Shao, Xiaohan Wang, Ruijie Quan, Yi Yang
2023-09-26
Audio and Speech Processing · Electrical Eng. & Systems
Multilingual Audio-Visual Speech Recognition with Hybrid CTC/RNN-T Fast Conformer
Maxime Burchi, Krishna C. Puvvada, Jagadeesh Balam, Boris Ginsburg +1
2024-05-24
Computer Vision and Pattern Recognition · Computer Science
Transformer-Based Video Front-Ends for Audio-Visual Speech Recognition for Single and Multi-Person Video
Dmitriy Serdyuk, Otavio Braga, Olivier Siohan
2022-11-02
Computation and Language · Computer Science
Open ASR Leaderboard: Towards Reproducible and Transparent Multilingual and Long-Form Speech Recognition Evaluation
Vaibhav Srivastav, Steven Zheng, Eric Bezzam, Eustache Le Bihan +5
2026-03-31
Audio and Speech Processing · Electrical Eng. & Systems
GIST-AiTeR System for the Diarization Task of the 2022 VoxCeleb Speaker Recognition Challenge
Dongkeon Park, Yechan Yu, Kyeong Wan Park, Ji Won Kim +1
2022-10-07
Audio and Speech Processing · Electrical Eng. & Systems
Accent Recognition with Hybrid Phonetic Features
Zhan Zhang, Xi Chen, Yuehai Wang, Jianyi Yang
2021-05-06
Computer Vision and Pattern Recognition · Computer Science
Facial Affect Recognition based on Transformer Encoder and Audiovisual Fusion for the ABAW5 Challenge
Ziyang Zhang, Liuwei An, Zishun Cui, Ao xu +6
2023-03-21
Audio and Speech Processing · Electrical Eng. & Systems
The NPU-ASLP System for Audio-Visual Speech Recognition in MISP 2022 Challenge
Pengcheng Guo, He Wang, Bingshen Mu, Ao Zhang +1
2023-03-14
Audio and Speech Processing · Electrical Eng. & Systems
GIST-AiTeR Speaker Diarization System for VoxCeleb Speaker Recognition Challenge (VoxSRC) 2023
Dongkeon Park, Ji Won Kim, Kang Ryeol Kim, Do Hyun Lee +1
2023-08-28
Computation and Language · Computer Science
Acoustically Precise Hesitation Tagging Is Essential for End-to-End Verbatim Transcription Systems
Jhen-Ke Lin, Hao-Chien Lu, Chung-Chun Wang, Hong-Yun Lin +1
2025-07-28
Audio and Speech Processing · Electrical Eng. & Systems
Hybrid Attention-based Encoder-decoder Model for Efficient Language Model Adaptation
Shaoshi Ling, Guoli Ye, Rui Zhao, Yifan Gong
2024-09-17
Audio and Speech Processing · Electrical Eng. & Systems
When Automatic Voice Disguise Meets Automatic Speaker Verification
Linlin Zheng, Jiakang Li, Meng Sun, Xiongwei Zhang +1
2020-09-16
Machine Learning · Computer Science
An Audio-Video Deep and Transfer Learning Framework for Multimodal Emotion Recognition in the wild
Denis Dresvyanskiy, Elena Ryumina, Heysem Kaya, Maxim Markitantov +2
2020-11-03