FilterAugment:一种声学环境数据增强方法
音频与语音处理
2022-02-08 v4
摘要
声学环境通过与声波传播的物理交互影响待识别声音的声音特性。因此,为音频与语音任务训练声学模型需要对各种声学环境进行正则化,以在真实应用中获得鲁棒性能。我们提出 FilterAugment,一种针对各种声学环境对声学模型进行正则化的数据增强方法。FilterAugment 通过对频带施加不同权重来模拟声学滤波器,从而使模型能从更宽频率区域提取相关信息。它是频域掩蔽的改进版,后者随机掩蔽频带上的信息。在多方声音检测分数(PSDS)方面,FilterAugment 将声音事件检测(SED)模型性能提升 6.50%,而频域掩蔽仅提升 2.13%。应用于与文本无关的说话人验证模型时,其等错误率(EER)达 1.22%,优于使用频域掩蔽的模型(EER 为 1.26%)。FilterAugment 的原型应用于我们参加的 DCASE 2021 挑战赛任务 4,并在取得第 3 名中发挥了主要作用。
引用
@article{arxiv.2110.03282,
title = {FilterAugment: An Acoustic Environmental Data Augmentation Method},
author = {Hyeonuk Nam and Seong-Hu Kim and Yong-Hwa Park},
journal= {arXiv preprint arXiv:2110.03282},
year = {2022}
}
备注
Accepted to ICASSP 2022