中文

多口音普通话干声演唱数据集:演唱口音识别基准

声音 2025-12-09 v1 人工智能

摘要

与语音口音研究相比,演唱口音研究尚处于探索不足的阶段,主要原因在于合适数据集的匮乏。现有的演唱数据集通常存在细节丢失,这通常源于声轨-乐器分离过程。此外,它们往往缺乏地区口音标注。为解决这一问题,我们提出了多口音普通话干声演唱数据集(MADVSD)。MADVSD 包含来自九个不同中国地区的 4,206 名母语为普通话的演唱者录制的超过 670 小时的干声录音。除每位参与者用其母语口音录制三首流行歌曲的音频外,他们还录制了覆盖所有普通话元音和完整八度音域的语音练习。我们通过演唱口音识别的基准实验验证了 MADVSD,证明了其在演唱语境中评估最先进语音模型的效用。此外,我们利用 MADVSD 独特的语音练习探索了方言对演唱口音的影响,并分析了元音在口音变化中的作用。

关键词

引用

@article{arxiv.2512.07005,
  title  = {Multi-Accent Mandarin Dry-Vocal Singing Dataset: Benchmark for Singing Accent Recognition},
  author = {Zihao Wang and Ruibin Yuan and Ziqi Geng and Hengjia Li and Xingwei Qu and Xinyi Li and Songye Chen and Haoying Fu and Roger B. Dannenberg and Kejun Zhang},
  journal= {arXiv preprint arXiv:2512.07005},
  year   = {2025}
}

备注

Accepted by ACMMM 2025