生成式口语语言建模如何编码含噪语音:从音位学到句法学的考察
计算与语言
2023-06-02 v1 人工智能
音频与语音处理
摘要
我们考察了生成式口语语言建模(GSLM)的语音建模潜力,其涉及使用从数据中学得的符号而非音素来进行语音分析与合成。由于 GSLM 促进了无文本口语处理,探索其有效性对于为口语处理的新范式铺平道路至关重要。本文展示了 GSLM 在口语层面与语音层面的编码与解码有效性发现。通过语音重合成实验,我们揭示重合成错误发生在从音位学到句法学的各个层面,且 GSLM 频繁重合成自然但内容被改变的语音。
引用
@article{arxiv.2306.00697,
title = {How Generative Spoken Language Modeling Encodes Noisy Speech: Investigation from Phonetics to Syntactics},
author = {Joonyong Park and Shinnosuke Takamichi and Tomohiko Nakamura and Kentaro Seki and Detai Xin and Hiroshi Saruwatari},
journal= {arXiv preprint arXiv:2306.00697},
year = {2023}
}
备注
Accepted to INTERSPEECH 2023