具有聚合机制的大型原始情感数据集
音频与语音处理
2022-12-26 v1
摘要
我们提出一个名为 Dusha 的用于语音情感识别(SER)任务的新数据集。该语料库包含约 350 小时数据、超过 300 000 条俄语语音音频记录及其转写文本,因此是当今最大的用于 SER 任务的开放双模态数据集合。它使用众包平台进行标注,并包含两个子集:表演型与真实生活型。表演型子集相比由音频播客构成的不平衡真实生活部分具有更均衡的类别分布。因此前者适用于模型预训练,后者则用于微调、模型验证与确认。本文描述了预处理流程、标注方式,以及使用基线模型的实验,以展示利用 Dusha 数据集可获得的若干实际指标。
引用
@article{arxiv.2212.12266,
title = {Large Raw Emotional Dataset with Aggregation Mechanism},
author = {Vladimir Kondratenko and Artem Sokolov and Nikolay Karpov and Oleg Kutuzov and Nikita Savushkin and Fyodor Minkin},
journal= {arXiv preprint arXiv:2212.12266},
year = {2022}
}
备注
6 pages, 1 figures, submitted to ICASSP 2023