Computation and Language · Computer Science
Speak & Improve Corpus 2025: an L2 English Speech Corpus for Language Assessment and Feedback
Kate Knill, Diane Nicholls, Mark J. F. Gales, Mengjie Qian +1
2024-12-18
Computation and Language · Computer Science
Speak & Improve Challenge 2025: Tasks and Baseline Systems
Mengjie Qian, Kate Knill, Stefano Banno, Siyuan Tang +3
2024-12-18
Computation and Language · Computer Science
TALCS: An Open-Source Mandarin-English Code-Switching Corpus and a Speech Recognition Baseline
Chengfei Li, Shuhao Deng, Yaoping Wang, Guangjing Wang +3
2022-06-28
Computation and Language · Computer Science
Experiments of ASR-based mispronunciation detection for children and adult English learners
Nina Hosseini-Kivanani, Roberto Gretter, Marco Matassoni, Giuseppe Daniele Falavigna
2021-04-14
Audio and Speech Processing · Electrical Eng. & Systems
DiDiSpeech: A Large Scale Mandarin Speech Corpus
Tingwei Guo, Cheng Wen, Dongwei Jiang, Ne Luo +7
2021-02-09
Computation and Language · Computer Science
Non-native Children's Automatic Speech Assessment Challenge (NOCASA)
Yaroslav Getman, Tamás Grósz, Mikko Kurimo, Giampiero Salvi
2025-08-14
Computation and Language · Computer Science
Common Voice: A Massively-Multilingual Speech Corpus
Rosana Ardila, Megan Branson, Kelly Davis, Michael Henretty +6
2020-03-09
Audio and Speech Processing · Electrical Eng. & Systems
An open-source voice type classifier for child-centered daylong recordings
Marvin Lavechin, Ruben Bousbib, Hervé Bredin, Emmanuel Dupoux +1
2025-03-12
Computation and Language · Computer Science
The Multilingual TEDx Corpus for Speech Recognition and Translation
Elizabeth Salesky, Matthew Wiesner, Jacob Bremerman, Roldano Cattoni +4
2021-06-16
Computation and Language · Computer Science
A Speech Test Set of Practice Business Presentations with Additional Relevant Texts
Dominik Macháček, Jonáš Kratochvíl, Tereza Vojtěchová, Ondřej Bojar
2019-08-05
Audio and Speech Processing · Electrical Eng. & Systems
Zero-Shot Speech LLMs for Multi-Aspect Evaluation of L2 Speech: Challenges and Opportunities
Aditya Kamlesh Parikh, Cristian Tejedor-Garcia, Catia Cucchiarini, Helmer Strik
2026-01-26
Computation and Language · Computer Science
RyanSpeech: A Corpus for Conversational Text-to-Speech Synthesis
Rohola Zandie, Mohammad H. Mahoor, Julia Madsen, Eshrat S. Emamian
2021-06-17
Computation and Language · Computer Science
VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation
Changhan Wang, Morgane Rivière, Ann Lee, Anne Wu +5
2021-07-28
Computation and Language · Computer Science
Phonetic and Prosody-aware Self-supervised Learning Approach for Non-native Fluency Scoring
Kaiqi Fu, Shaojun Gao, Shuju Shi, Xiaohai Tian +2
2023-05-22
Artificial Intelligence · Computer Science
Towards measuring fairness in speech recognition: Fair-Speech dataset
Irina-Elena Veliche, Zhuangqun Huang, Vineeth Ayyat Kochaniyan, Fuchun Peng +2
2024-08-26
Computation and Language · Computer Science
Google Crowdsourced Speech Corpora and Related Open-Source Resources for Low-Resource Languages and Dialects: An Overview
Alena Butryna, Shan-Hui Cathy Chu, Isin Demirsahin, Alexander Gutkin +17
2020-10-15
Audio and Speech Processing · Electrical Eng. & Systems
A Crowdsourced Open-Source Kazakh Speech Corpus and Initial Speech Recognition Baseline
Yerbolat Khassanov, Saida Mussakhojayeva, Almas Mirzakhmetov, Alen Adiyev +2
2021-07-22
Computation and Language · Computer Science
A Corpus for Sentence-level Subjectivity Detection on English News Articles
Francesco Antici, Andrea Galassi, Federico Ruggeri, Katerina Korre +4
2024-05-27
Audio and Speech Processing · Electrical Eng. & Systems
CUCHILD: A Large-Scale Cantonese Corpus of Child Speech for Phonology and Articulation Assessment
Si-Ioi Ng, Cymie Wing-Yee Ng, Jiarui Wang, Tan Lee +2
2020-08-10
Computation and Language · Computer Science
Speech-MASSIVE: A Multilingual Speech Dataset for SLU and Beyond
Beomseok Lee, Ioan Calapodescu, Marco Gaido, Matteo Negri +1
2024-08-08
Computation and Language · Computer Science
AppTek Call-Center Dialogues: A Multi-Accent Long-Form Benchmark for English ASR
Eugen Beck, Sarah Beranek, Uma Moothiringote, Daniel Mann +3
2026-05-01