中文

DnR-nonverbal: 包含非言语声音的电影音频源分离数据集

声音 2025-06-10 v2 音频与语音处理

摘要

我们提出了一个用于电影音频源分离 (CASS) 的新数据集,该数据集可处理非言语声音。现有 CASS 数据集仅包含朗读风格的声音作为语音干声。这些数据集与实际电影音频不同,后者更可能包含表演出的声音。因此,在常规数据集上训练的模型往往存在问题,即情绪高涨的声音(如笑声和尖叫声)更容易被分离为音效而非语音。为解决此问题,我们构建了新数据集 DnR-nonverbal。所提数据集在语音干声中包含了笑声和尖叫声等非言语声音。通过实验,我们揭示了当前 CASS 模型在非言语声音提取上的问题,并表明我们的数据集能在合成和实际电影音频中有效解决该问题。我们的数据集可在 https://zenodo.org/records/15470640 获取。

关键词

引用

@article{arxiv.2506.02499,
  title  = {DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds},
  author = {Takuya Hasumi and Yusuke Fujita},
  journal= {arXiv preprint arXiv:2506.02499},
  year   = {2025}
}

备注

Accepted to Interspeech 2025, 5 pages, 3 figures, dataset is available at https://zenodo.org/records/15470640