中文

语音情感分段标注:何种情感在何时出现?

计算与语言 2023-10-23 v2

摘要

语音情感识别(SER)通常依赖于语句级方案。然而,通过语音传达的情感应被视为具有明确时间边界的离散语音事件,而非整个语句的属性。为反映语音情感的细粒度特性,我们提出一项新任务:语音情感分段标注(SED)。正如说话人分段标注回答“谁在何时说话?”这一问题,语音情感分段标注回答“何种情感在何时出现?”。为便于评估性能并为研究者建立通用基准,我们引入了 Zaion 情感数据集(ZED),这是一个公开可获取的语音情感数据集,包含真实生活条件下记录的非演绎情感,以及语句内情感片段的手动标注边界。我们提供了具有竞争力的基线,并开源了代码与预训练模型。

关键词

引用

@article{arxiv.2306.12991,
  title  = {Speech Emotion Diarization: Which Emotion Appears When?},
  author = {Yingzhi Wang and Mirco Ravanelli and Alya Yacoubi},
  journal= {arXiv preprint arXiv:2306.12991},
  year   = {2023}
}

备注

Accepted to ASRU 2023