发声表达情绪的语音学基础:自然与表演之比较
音频与语音处理
2020-07-28 v3 计算与语言
机器学习
声音
摘要
发声情绪能否被模拟?这一疑问始终是语音学界反复关切的问题,并已得到 vigorous 的探究。其与表演情绪数据库有效性问题的关联进一步推动了该探究。大量语音与发声情绪研究依赖表演情绪数据库作为研究自然情绪的有效替代。为建立可泛化至自然场景的模型,使用有效的原型至关重要——即那些可假定可靠代表自然情绪的原型。更具体地,从生理与心理伴随特征角度,研究表演情绪相对于自然情绪十分重要。在本文中,我们呈现一项关于自然与表演发声情绪差异的规模化系统研究。我们利用基于自注意力(self-attention)的情绪分类模型,通过发现每类情绪中'最受关注'的音素,来理解情绪的语音学基础。继而,我们比较这些受关注音素在表演与自然类别中的重要性及分布。我们的检验显示,表演与自然语音在音素的使用方式与选择上存在显著差异,从而得出:使用表演语音数据库进行情绪分类任务的有效性及价值为中度至低度。
引用
@article{arxiv.1911.05733,
title = {The phonetic bases of vocal expressed emotion: natural versus acted},
author = {Hira Dhamyal and Shahan Ali Memon and Bhiksha Raj and Rita Singh},
journal= {arXiv preprint arXiv:1911.05733},
year = {2020}
}
备注
5 pages, 6 figures