中文

SonicSim:用于移动声源场景下语音处理的可定制化仿真平台

声音 2025-03-07 v2 人工智能 音频与语音处理

摘要

系统评估移动声源条件下的语音分离和增强模型需要大量且多样化的数据。然而,真实数据集往往缺乏足够的数据用于训练和评估,而人工合成数据虽然庞大,却缺乏声学真实性。因此,两者都未能有效满足实际需求。为此,我们引入了SonicSim——一个基于具身人工智能仿真平台Habitat-sim设计的合成数据工具包,旨在为移动声源生成高度可定制化的数据。SonicSim支持多层次的调整,包括场景级、麦克风级和声源级调整,能够创建更加多样化的合成数据。利用SonicSim,我们构建了名为SonicSet的基准数据集,采用LibriSpeech、Freesound Dataset 50k(FSD50K)、Free Music Archive(FMA)以及来自Matterport3D的90个场景,对语音分离和增强模型进行评估。此外,为探讨合成数据与真实数据之间的差异,我们从SonicSet验证集中选取了5小时的原始、无混响数据,并记录了一个真实的语音分离数据集,以此为比较SonicSet与其他合成数据集提供参考。对于语音增强,我们利用真实数据集RealMAN来验证SonicSet与现有合成数据集之间的声学差距。结果表明,基于SonicSet训练的模型在真实场景中的泛化能力优于其他合成数据集。代码已公开于https://cslikai.cn/SonicSim/。

关键词

引用

@article{arxiv.2410.01481,
  title  = {SonicSim: A customizable simulation platform for speech processing in moving sound source scenarios},
  author = {Kai Li and Wendi Sang and Chang Zeng and Runxuan Yang and Guo Chen and Xiaolin Hu},
  journal= {arXiv preprint arXiv:2410.01481},
  year   = {2025}
}

备注

Accepted by ICLR 2025