中文

大规模伪立体声数据与不同语音基础模型对话式生成式 spoken language model 的影响研究

计算与语言 2024-07-03 v1 人机交互 声音 音频与语音处理

摘要

近期的 spoken dialogue modeling 努力旨在无需直接转录即可合成 spoken dialogue,从而保留 speech 中固有的非文本信息。然而,这种方法在说话者同时发言时面临挑战,需要带有说话者分别记录在不同通道上的 stereo dialogue data,而这类资源相对稀缺。为此,我们开发了一种 innovative pipeline,将 single-channel dialogue data 转换为 pseudo-stereo data。这扩展了我们的训练数据集规模,从仅 2000 小时增至惊人的 17,600 小时,显著丰富了训练样本的多样性和质量。该伪立体数据的结果被证明在提高 spoken dialogue language model 的性能方面有效。此外,我们探索了使用不同 speech foundation model 的离散单位用于 spoken dialogue 生成。

关键词

引用

@article{arxiv.2407.01911,
  title  = {Investigating the Effects of Large-Scale Pseudo-Stereo Data and Different Speech Foundation Model on Dialogue Generative Spoken Language Model},
  author = {Yu-Kuan Fu and Cheng-Kuang Lee and Hsiu-Hsuan Wang and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2407.01911},
  year   = {2024}
}

备注

submitted to interspeech 2024