ICML 2022 富有表现力的发声研讨会与竞赛:识别、生成和个性化发声爆发
音频与语音处理
2022-07-13 v3 机器学习
声音
摘要
ICML 富有表现力的发声(ExVo)竞赛致力于理解和生成发声爆发:笑声、倒吸气声、哭声以及其他对情感表达和交流至关重要的非语言发声。ExVo 2022 包含三个竞赛赛道,使用来自 1702 名说话人的 59201 条大规模发声数据集。第一项 ExVo-MultiTask 要求参与者训练一个多任务模型,从发声爆发中识别表达的情感和人口统计学特征。第二项 ExVo-Generate 要求参与者训练一个生成模型,产生传达十种不同情感的发声爆发。第三项 ExVo-FewShot 要求参与者利用融合说话人身份的少样本学习来训练一个识别发声爆发所传达的 10 种情感的模型。本文描述了这三个赛道,并提供了使用最先进机器学习策略的基线模型性能度量。各赛道基线如下:对于 ExVo-MultiTask,计算一致性相关系数(CCC)、未加权平均召回率(UAR)和倒置平均绝对误差(MAE)的调和平均数得到的综合得分()最优为 0.335 ;对于 ExVo-Generate,我们报告训练集与生成样本之间 Fréchet inception distance(FID)得分在 4.81 到 8.27 之间(取决于情感)。随后我们将倒置 FID 与生成样本的感知评分结合()得到 0.174 ;对于 ExVo-FewShot,获得平均 CCC 为 0.444。
引用
@article{arxiv.2205.01780,
title = {The ICML 2022 Expressive Vocalizations Workshop and Competition: Recognizing, Generating, and Personalizing Vocal Bursts},
author = {Alice Baird and Panagiotis Tzirakis and Gauthier Gidel and Marco Jiralerspong and Eilif B. Muller and Kory Mathewson and Björn Schuller and Erik Cambria and Dacher Keltner and Alan Cowen},
journal= {arXiv preprint arXiv:2205.01780},
year = {2022}
}