中文

语音声学上下文与情感识别关系的实证解释

声音 2023-07-03 v1 人工智能 机器学习 音频与语音处理

摘要

语音情感识别(SER)对于获取情感智能和理解语音的上下文含义至关重要。辅音-元音(CV)音位边界的变化可用语言线索丰富声学上下文,从而影响 SER。在实践中,语音情感在给定时长的声学段上被视为单一标签。然而,语音内的音子边界并非离散事件,因此感知到的情感状态也应分布在潜在连续的时间窗上。本研究利用基于注意力的方法,探究声学上下文与音子边界对 SER 局部标记的影响。跨语料库分析实验的结果支持了使用分布式方法进行语音情感理解的优势。在实验中,将音子和词映射至注意力向量,并连同基频观察其重叠分布,从而揭示声学上下文与情感之间的关系。本工作旨在将心理语言学理论研究与水计算建模相桥接以用于 SER。

关键词

引用

@article{arxiv.2306.17500,
  title  = {Empirical Interpretation of the Relationship Between Speech Acoustic Context and Emotion Recognition},
  author = {Anna Ollerenshaw and Md Asif Jalal and Rosanna Milner and Thomas Hain},
  journal= {arXiv preprint arXiv:2306.17500},
  year   = {2023}
}