PAREDA:面向自然语言处理研究讨论的多方言语音数据集
计算与语言
2026-05-19 v1 人工智能
摘要
虽然现代自动语音识别(ASR)系统在基准语料库上取得高准确率,但在面临真实世界变异性时性能常常下降。本工作聚焦于由于 accented、自发且领域特定语音导致的变异性。在本领域中,我们引入PAper REading DAtaset(PAREDA),这是一套首个多方言语音数据集,包含关于自然语言处理(NLP)论文的讨论,发言人拥有澳大利亚英语、印度英语和中国英语等不同方言。每个会话都引导进行自述(对论文摘要的概述)和非自述(参与者之间的问答)模式,构建了一个富含专业术语和对话现象的语料库。我们在PAREDA上评估了SOTA ASR模型的性能,分析了方言混合和语速增加的影响。我们的结果表明,在零样本设置下,模型表现较差,确认了该数据集的具备挑战性。然而,针对PAREDA进行微调可显著降低词错误率(WER),表明该数据集捕捉了现有语料库中常缺失的语言特征。PAREDA为构建和评估面向特殊化真实世界应用的更稳健、更包容性的ASR系统提供了宝贵的新资源。
引用
@article{arxiv.2605.17860,
title = {PAREDA: A Multi-Accent Speech Dataset of Natural Language Processing Research Discussions},
author = {Sicheng Jin and Dipankar Srirag and Aditya Joshi},
journal= {arXiv preprint arXiv:2605.17860},
year = {2026}
}
备注
Accepted and presented at SPEAKABLE 2026 workshop at LREC 2026