CAPTDURE:单声源带描述声音数据集
声音
2023-05-30 v1 音频与语音处理
摘要
在利用描述文本进行环境声音分离与合成的传统研究中,使用了由多声源声音及其描述文本组成的数据集进行模型训练。然而,当我们为多声源声音收集描述文本时,不易收集到针对每个声源的详细描述,例如声音出现次数和音色。因此,利用传统的带描述声音数据集的模型训练方法难以仅提取出单声源目标声音。在本工作中,我们构建了一个带有单声源声音描述文本的数据集,名为 CAPTDURE,它可用于环境声音分离与合成等多种任务。我们的数据集包含 1,044 个声音和 4,902 条描述文本。我们使用该数据集评估了环境声音提取的性能。实验结果表明,单声源声音的描述文本在从混合声音中仅提取单声源目标声音方面是有效的。
引用
@article{arxiv.2305.17758,
title = {CAPTDURE: Captioned Sound Dataset of Single Sources},
author = {Yuki Okamoto and Kanta Shimonishi and Keisuke Imoto and Kota Dohi and Shota Horiguchi and Yohei Kawaguchi},
journal= {arXiv preprint arXiv:2305.17758},
year = {2023}
}
备注
Accepted to INTERSPEECH2023