中文

生成式口语语言建模如何编码含噪语音:从音位学到句法学的考察

计算与语言 2023-06-02 v1 人工智能 音频与语音处理

摘要

我们考察了生成式口语语言建模(GSLM)的语音建模潜力,其涉及使用从数据中学得的符号而非音素来进行语音分析与合成。由于 GSLM 促进了无文本口语处理,探索其有效性对于为口语处理的新范式铺平道路至关重要。本文展示了 GSLM 在口语层面与语音层面的编码与解码有效性发现。通过语音重合成实验,我们揭示重合成错误发生在从音位学到句法学的各个层面,且 GSLM 频繁重合成自然但内容被改变的语音。

关键词

引用

@article{arxiv.2306.00697,
  title  = {How Generative Spoken Language Modeling Encodes Noisy Speech: Investigation from Phonetics to Syntactics},
  author = {Joonyong Park and Shinnosuke Takamichi and Tomohiko Nakamura and Kentaro Seki and Detai Xin and Hiroshi Saruwatari},
  journal= {arXiv preprint arXiv:2306.00697},
  year   = {2023}
}

备注

Accepted to INTERSPEECH 2023