中文

探究大语言模型惊奇度在语音合成韵律中的效用

音频与语音处理 2023-06-19 v1 计算与语言

摘要

本文研究了将词惊奇度(在给定语境中一个词可预测性的度量)作为辅助语音合成韵律特征的使用。我们探究从大语言模型 (LLMs) 提取的词惊奇度如何与词凸显度(给定话语中一个词显著性的基于信号的度量)相关。我们还考察了上下文长度和 LLM 规模对结果的影响,以及以惊奇度值作为条件的语音合成器与基线系统的比较。为评估这些因素,我们使用大型英语文本语料库和不同规模的 LLM 进行了实验。我们的结果表明词惊奇度与词凸显度呈中等程度相关,说明它们捕捉了语言使用中相关但不同的方面。我们发现上下文长度和 LLM 规模会影响相关性,但方向出乎意料:较长的上下文和较大的 LLM 通常以近乎线性的方式低估凸显词。我们证明,与这些发现一致,以惊奇度值作为条件的语音合成器相较基线仅有微小改进,结果表明使用惊奇度值来引出恰当凸显模式的效应有限。

关键词

引用

@article{arxiv.2306.09814,
  title  = {Investigating the Utility of Surprisal from Large Language Models for Speech Synthesis Prosody},
  author = {Sofoklis Kakouros and Juraj Šimko and Martti Vainio and Antti Suni},
  journal= {arXiv preprint arXiv:2306.09814},
  year   = {2023}
}

备注

Accepted at SSW 2023