中文

众包与自动语音显著度估计

音频与语音处理 2023-12-27 v2 声音

摘要

口语词的显著度是指普通母语听者相对于上下文感知该词突出或强调的程度。语音显著度估计是对话语中每个词的显著度赋予数值的过程。这些显著度标注有助于语言分析,以及训练自动化系统以执行强调可控的文本转语音或情感识别。人工标注显著度耗时且昂贵,这推动了自动化语音显著度估计方法的发展。然而,使用机器学习方法开发此类自动化系统需要人工标注的训练数据。利用我们获取此类人工标注的系统,我们收集并开源了 LibriTTS 数据集一部分的众包标注。我们使用这些标注作为真值来训练一个可泛化至未知说话人、数据集和说话风格的神经语音显著度估计器。我们研究了神经显著度估计的设计决策,以及神经显著度估计如何随标注成本的两个关键因素——数据集规模和每句话语标注数量——而提升。

关键词

引用

@article{arxiv.2310.08464,
  title  = {Crowdsourced and Automatic Speech Prominence Estimation},
  author = {Max Morrison and Pranav Pawar and Nathan Pruyne and Jennifer Cole and Bryan Pardo},
  journal= {arXiv preprint arXiv:2310.08464},
  year   = {2023}
}

备注

Published as a conference paper at ICASSP 2024