中文

面向可泛化语音情感识别:基于软标注与数据增强的大规模多语言语音时序情感迁移建模

计算与语言 2023-11-16 v1 机器学习 音频与语音处理

摘要

识别口语交流中的情感对于高级人机交互至关重要。当前的情感检测方法在跨语料库应用时常表现出偏差。为此,本研究整合了16个多样化数据集,得到涵盖英语、中文和日语等语言的375小时数据。我们提出了一种软标注系统以捕捉梯度化的情感强度。利用Whisper编码器和受对比学习启发的数据增强方法,我们的方法强调情感的时间动态特性。我们在四个多语言数据集上的验证显示出显著的零样本泛化能力。我们发布了开源模型权重以及在Hume-Prosody上微调后初步的 promising 结果。

关键词

引用

@article{arxiv.2311.08607,
  title  = {Towards Generalizable SER: Soft Labeling and Data Augmentation for Modeling Temporal Emotion Shifts in Large-Scale Multilingual Speech},
  author = {Mohamed Osman and Tamer Nadeem and Ghada Khoriba},
  journal= {arXiv preprint arXiv:2311.08607},
  year   = {2023}
}

备注

Accepted as talk at NeurIPS ML for Audio workshop