Audio and Speech Processing · Electrical Eng. & Systems
Weakly Supervised Construction of ASR Systems with Massive Video Data
Mengli Cheng, Chengyu Wang, Xu Hu, Jun Huang +1
2020-09-22
Computer Vision and Pattern Recognition · Computer Science
SlideAVSR: A Dataset of Paper Explanation Videos for Audio-Visual Speech Recognition
Hao Wang, Shuhei Kurita, Shuichiro Shimizu, Daisuke Kawahara
2024-07-03
Audio and Speech Processing · Electrical Eng. & Systems
MSR-86K: An Evolving, Multilingual Corpus with 86,300 Hours of Transcribed Audio for Speech Recognition Research
Song Li, Yongbin You, Xuezhi Wang, Zhengkun Tian +2
2024-06-27
Machine Learning · Computer Science
Pseudo Label Is Better Than Human Label
Dongseong Hwang, Khe Chai Sim, Zhouyuan Huo, Trevor Strohman
2022-07-05
Computation and Language · Computer Science
Halving transcription time: A fast, user-friendly and GDPR-compliant workflow to create AI-assisted transcripts for content analysis
Jakob Sponholz, Andreas Weilinghoff, Juliane Schopf
2025-04-22
Computation and Language · Computer Science
Teach me with a Whisper: Enhancing Large Language Models for Analyzing Spoken Transcripts using Speech Embeddings
Fatema Hasan, Yulong Li, James Foulds, Shimei Pan +1
2023-11-14
Computer Vision and Pattern Recognition · Computer Science
LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale
Joya Chen, Ziyun Zeng, Yiqi Lin, Wei Li +2
2025-04-23
Computation and Language · Computer Science
Measuring the Accuracy of Automatic Speech Recognition Solutions
Korbinian Kuhn, Verena Kersken, Benedikt Reuter, Niklas Egger +1
2024-08-30
Computation and Language · Computer Science
A Case Study on Combining ASR and Visual Features for Generating Instructional Video Captions
Jack Hessel, Bo Pang, Zhenhai Zhu, Radu Soricut
2019-10-08
Audio and Speech Processing · Electrical Eng. & Systems
From Weak Labels to Strong Results: Utilizing 5,000 Hours of Noisy Classroom Transcripts with Minimal Accurate Data
Ahmed Adel Attia, Dorottya Demszky, Jing Liu, Carol Espy-Wilson
2026-02-24
Computation and Language · Computer Science
VT-SSum: A Benchmark Dataset for Video Transcript Segmentation and Summarization
Tengchao Lv, Lei Cui, Momcilo Vasilijevic, Furu Wei
2021-07-16
Computation and Language · Computer Science
A Recorded Debating Dataset
Shachar Mirkin, Michal Jacovi, Tamar Lavee, Hong-Kwang Kuo +5
2018-03-28
Computation and Language · Computer Science
A Speech Test Set of Practice Business Presentations with Additional Relevant Texts
Dominik Macháček, Jonáš Kratochvíl, Tereza Vojtěchová, Ondřej Bojar
2019-08-05
Audio and Speech Processing · Electrical Eng. & Systems
Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation
Andrew Rouditchenko, Yuan Gong, Samuel Thomas, Leonid Karlinsky +3
2024-11-21
Computation and Language · Computer Science
Transcribing Children's Speech: ASR Performance and Obtaining Reliable Orthographic Transcriptions
Gus Lathouwers, Lingyun Gao, Catia Cucchiarini, Helmer Strik
2026-05-29
Computation and Language · Computer Science
Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation
Dancheng Liu, Amir Nassereldine, Chenhui Xu, Jinjun Xiong
2025-05-28
Computation and Language · Computer Science
Lost in Transcription: Identifying and Quantifying the Accuracy Biases of Automatic Speech Recognition Systems Against Disfluent Speech
Dena Mujtaba, Nihar R. Mahapatra, Megan Arney, J. Scott Yaruss +3
2024-05-13