嘎裂声时间激励模式的数据驱动检测与分析
音频与语音处理
2020-06-02 v1 计算与语言
声音
摘要
本文研究嘎裂声(creaky voice)的时间激励模式。嘎裂声是一种常作为短语边界标记、也用于表达态度、情感状态乃至社会地位的嗓音音质。因此,嘎裂声的自动检测与建模可能对语音技术应用产生影响。然而,嘎裂声的声学特征与常态发声(modal phonation)截然不同。此外,多种声学模式均可引发嘎裂声的感知,从而使其自动检测、分析与建模策略复杂化。本研究使用多种语言、说话人以及朗读与对话数据,并基于互信息对文献中提出的各种用于检测嘎裂声的声学特征进行评估。随后将这些特征用于分类实验,与现有最优方法相比,我们取得了检测精度的显著提升。两项实验均清晰凸显了多种嘎裂声模式的存在。进而对所识别模式进行定性与定量分析,揭示出这些嘎裂声模式的使用存在显著的说话人相关变异性。我们还研究了嘎裂声检测系统在不同嘎裂声模式上的表现。
引用
@article{arxiv.2006.00518,
title = {Data-driven Detection and Analysis of the Patterns of Creaky Voice},
author = {Thomas Drugman and John Kane and Christer Gobl},
journal= {arXiv preprint arXiv:2006.00518},
year = {2020}
}