DOTA-ME-CS:日常语境中文-英语代码切换语音数据集
声音
2025-11-14 v2 音频与语音处理
摘要
代码切换是指在交际过程中在两种或多种语言之间交替使用,为自动语音识别 (ASR) 系统带来巨大挑战。现有模型和数据集在有效处理这些挑战方面存在不足。为填补这一差距并推动代码切换 ASR 研究的进展,我们引入 DOTA-ME-CS:日常语境中文-英语代码切换数据集,该数据集包含 18.54 小时的音频数据,包括来自 34 名参与者的 9,300 段录音。为增强数据集的多样性,我们应用人工智能技术,如 AI 音色合成、语速变化和噪声添加,从而增加任务的复杂度和可扩展性。该数据集经过精心策划,以确保其多样性和质量,为研究人员解决双语语音识别的复杂性提供了稳健资源,并进行详细的数据分析。我们进一步展示了该数据集在未来研究中的潜力。DOTA-ME-CS 数据集及其附带代码将对外公开提供。
引用
@article{arxiv.2501.12122,
title = {DOTA-ME-CS: Daily Oriented Text Audio-Mandarin English-Code Switching Dataset},
author = {Yupei Li and Zifan Wei and Heng Yu and Jiahao Xue and Huichi Zhou and Björn W. Schuller},
journal= {arXiv preprint arXiv:2501.12122},
year = {2025}
}