基于 ResNets 与预训练副语言 Conformers 的多任务语音突发建模
声音
2022-06-28 v1 机器学习
音频与语音处理
摘要
本技术报告介绍了我们提交给 ICML 表现性发声研讨会与竞赛多任务赛道(ExVo-MultiTask)所使用的建模方法。我们首先在语音突发的梅尔谱图表示上应用了各种尺寸的图像分类模型,正如声音事件检测文献中的标准做法。这些模型的结果显示,相对于任务指标的调和平均,比基线系统提高了 21.24%,并构成了我们团队向 MultiTask 赛道的主要提交。然后我们试图通过应用一个大型预训练 Conformer 模型来刻画 MultiTask 赛道的提升空间,该模型此前在语音情感识别和口罩检测等副语言任务上取得了最先进的结果。我们还额外研究了情感表达、原产国和年龄预测子任务之间的关系,并发现性能最佳的模型是作为单任务模型训练的,这令人质疑该问题是否真正受益于多任务设置。
引用
@article{arxiv.2206.12494,
title = {Multitask vocal burst modeling with ResNets and pre-trained paralinguistic Conformers},
author = {Josh Belanich and Krishna Somandepalli and Brian Eoff and Brendan Jou},
journal= {arXiv preprint arXiv:2206.12494},
year = {2022}
}
备注
To be published in the ICML Expressive Vocalizations Workshop & Competition 2022 (https://www.competitions.hume.ai/exvo2022)