生成式口语对话语言建模
计算与语言
2022-11-24 v2 机器学习
声音
音频与语音处理
摘要
我们介绍了 dGSLM,这是首个能够生成自然口语对话音频样本的“无文本”模型。它利用近期在无监督语音单元发现方面的研究,结合在 2000 小时双通道原始对话音频(Fisher 数据集)上训练、带有交叉注意力的双塔 transformer 架构,且不使用任何文本或标签。我们表明,与基于文本的级联模型相比,我们的模型能够同时在两个通道中生成语音、笑声及其他副语言信号,并再现更自然、更流畅的轮流对话。
引用
@article{arxiv.2203.16502,
title = {Generative Spoken Dialogue Language Modeling},
author = {Tu Anh Nguyen and Eugene Kharitonov and Jade Copet and Yossi Adi and Wei-Ning Hsu and Ali Elkahky and Paden Tomasello and Robin Algayres and Benoit Sagot and Abdelrahman Mohamed and Emmanuel Dupoux},
journal= {arXiv preprint arXiv:2203.16502},
year = {2022}
}