中文

保留声音情感线索的声学驱动音素移除

音频与语音处理 2023-03-15 v2 声音

摘要

在本文中,我们提出了一种从语音中移除语言信息的方法,目的是分离出情感的副语言指标。该方法的直接用途在于对声音情感的敏感性进行临床测试,这些测试不受语言干扰,而语言能力在多种临床人群中存在损伤。该方法基于语音音频和声门电图(EGG)信号的同步记录。语音音频信号用于估计平均声道滤波器响应和振幅包络。EGG信号提供了声源活动的直接关联,该活动在很大程度上独立于语音发音。将语音音频的动态能量和平均声道滤波器应用于EGG信号,以创建第三个信号,该信号旨在尽可能多地捕获来自发声系统的副语言信息——最大限度地保留影响情感的生物声学线索——同时消除指向言语含义的语音线索。为了评估该方法的成功,我们在一项在线听众情感评分实验中,研究了对应语音音频和转换后EGG信号的感知。结果显示,匹配信号在感知情感上具有高度相似性,表明我们的方法是有效的。

关键词

引用

@article{arxiv.2210.15001,
  title  = {Acoustically-Driven Phoneme Removal That Preserves Vocal Affect Cues},
  author = {Camille Noufi and Jonathan Berger and Karen J. Parker and Daniel L. Bowling},
  journal= {arXiv preprint arXiv:2210.15001},
  year   = {2023}
}

备注

To be seen in proceedings of the 2023 IEEE International Conference on Acoustics, Speech and Signal Processing (DOI coming soon)