中文

利用微调wav2vec 2.0预测情感性发声爆发

音频与语音处理 2022-10-27 v2

摘要

从人声中预测情感状态的研究一直严重依赖于语音。本研究实际上探索了从人的发声爆发(一种短的非言语发声)中识别其情感状态。借鉴wav2vec 2.0近期成功的思路,我们评估了来自不同数据集的微调wav2vec 2.0模型,以从其发声爆发中预测说话者的情感状态。这些微调的wav2vec 2.0模型随后在发声爆发数据上训练。结果表明,微调的wav2vec 2.0模型,特别是在一个情感语音数据集上,优于基线模型(即手工声学特征)。然而,在非情感语音数据集上微调的模型与在情感语音数据集上微调的模型之间差距不大。

关键词

引用

@article{arxiv.2209.13146,
  title  = {Predicting Affective Vocal Bursts with Finetuned wav2vec 2.0},
  author = {Bagus Tris Atmaja and Akira Sasou},
  journal= {arXiv preprint arXiv:2209.13146},
  year   = {2022}
}