用于年龄、情绪与国籍预测的自监督与可学习谱时 receptive 场
声音
2022-06-28 v1 人工智能
音频与语音处理
摘要
本工作提出了一种多任务方法,用于在 2022 年 ICML 表达性发声挑战赛 ExVo-MultiTask 赛道中,根据发声爆发音频同时估计年龄、原产国和情绪。所选方法结合了谱时调制与自监督特征,随后采用按多任务范式组织的编码器-解码器网络。我们通过考察独立的任务特定模型与联合模型来评估各任务之间的互补性,并探究不同特征集的相对优势。我们还引入了一种简单的分数融合机制,以利用不同特征集对该任务的互补性。我们发现,稳健的数据预处理结合谱时感受野与 HuBERT 模型上的分数融合,取得了我们最佳的 ExVo-MultiTask 测试分数 0.412。
引用
@article{arxiv.2206.12568,
title = {Self-supervision and Learnable STRFs for Age, Emotion, and Country Prediction},
author = {Roshan Sharma and Tyler Vuong and Mark Lindsey and Hira Dhamyal and Rita Singh and Bhiksha Raj},
journal= {arXiv preprint arXiv:2206.12568},
year = {2022}
}