FrAUG:一种基于帧率的语音信号抑郁检测数据增强方法
音频与语音处理
2022-02-15 v1 信号处理
摘要
本文提出一种用于语音信号抑郁检测的数据增强方法。通过在特征提取过程中改变帧宽与帧移参数来创建数据增强样本。与其他数据增强方法(如VTLP、音高扰动或速度扰动)不同,所提方法不显式改变声学参数,而是改变帧级特征的时间-频率分辨率。我们使用两个不同数据集、模型与输入声学特征评估了该方法。对于DAIC-WOZ(英文)数据集,当使用DepAudioNet模型并以mel谱图作为输入时,与基线相比所提方法在验证集和测试集上分别提升5.97%和25.13%。对于CONVERGE(普通话)数据集,当使用x-vector嵌入配合CNN作为后端并以MFCC作为输入特征时,验证集和测试集上的提升分别为9.32%和12.99%。基线系统未采用任何数据增强。此外,所提方法优于噪声增强、VTLP、速度扰动和音高扰动等常用数据增强方法。所有提升均具统计显著性。
引用
@article{arxiv.2202.05912,
title = {FrAUG: A Frame Rate Based Data Augmentation Method for Depression Detection from Speech Signals},
author = {Vijay Ravi and Jinhan Wang and Jonathan Flint and Abeer Alwan},
journal= {arXiv preprint arXiv:2202.05912},
year = {2022}
}
备注
Accepted to ICASSP 2022. copyright 2022 IEEE. Personal use of this material is permitted