中文

普通话多模态情感语音数据库的构建与评估

音频与语音处理 2024-01-17 v1 人工智能 声音 信号处理

摘要

设计并建立了一个包含发音运动学、声学、声门和面部微表情的多模态情感语音普通话数据库,从语料设计、受试者选择、录音细节和数据处理等方面进行了详细描述。其中信号用离散情感标签(中性、快乐、愉悦、冷漠、愤怒、悲伤、悲痛)和维度情感标签(愉悦度、唤醒度、支配度)进行标注。本文通过对维度标注数据的统计分析验证了维度标注的有效性。验证了标注者的SCL-90量表数据,并结合PAD标注数据进行分析,以探索标注中的异常现象与标注者心理状态之间的内在关系。为了验证数据库的语音质量和情感区分度,本文使用SVM、CNN和DNN三种基础模型计算了这七种情感的识别率。结果表明,仅使用声学数据时,七种情感的平均识别率约为82%。仅使用声门数据时,平均识别率约为72%。仅使用运动学数据时,平均识别率也达到55.7%。因此,该数据库质量较高,可作为语音分析研究的重要来源,尤其适用于多模态情感语音分析任务。

关键词

引用

@article{arxiv.2401.07336,
  title  = {Construction and Evaluation of Mandarin Multimodal Emotional Speech Database},
  author = {Zhu Ting and Li Liangqi and Duan Shufei and Zhang Xueying and Xiao Zhongzhe and Jia Hairng and Liang Huizhi},
  journal= {arXiv preprint arXiv:2401.07336},
  year   = {2024}
}