中文

SaSLaW:面向环境自适应对话语音合成的、包含视听第一人称信息的对话语音语料库

音频与语音处理 2024-08-14 v1

摘要

本文介绍了 SaSLaW,一个自发对话语音语料库,包含说话者所说、所听和所看内容的同步录音。在面对面语音交流中,人类会考虑多样的环境因素,然后控制其话语的特征。能够适应这些音频环境的口语对话系统可以实现自然无缝的交流。SaSLaW 的开发旨在通过自发对话中的第一人称视听感知,为音频环境中的人类语音调整建模。我们提出了 SaSLaW 的构建方法,并展示了该语料库的分析结果。此外,我们进行了一项实验,利用 SaSLaW 开发文本到语音模型,并评估其适应音频环境的性能。结果表明,与普通的文本到语音模型相比,结合了听觉音频数据的模型能够输出更合理、更贴合多样音频环境的语音。

引用

@article{arxiv.2408.06858,
  title  = {SaSLaW: Dialogue Speech Corpus with Audio-visual Egocentric Information Toward Environment-adaptive Dialogue Speech Synthesis},
  author = {Osamu Take and Shinnosuke Takamichi and Kentaro Seki and Yoshiaki Bando and Hiroshi Saruwatari},
  journal= {arXiv preprint arXiv:2408.06858},
  year   = {2024}
}

备注

5 pages, accepted for INTERSPEECH 2024