分析和缓解离散音频标记在神经编解码器语言模型中的不一致性
音频与语音处理
2024-10-08 v2 声音
摘要
在大型语言模型(LLMs)的推进下,音频处理领域对使用离散音频标记序列来训练音频生成任务越来越感兴趣。然而,直接通过神经音频编解码器离散化音频,常常导致与文本序列根本不同的序列。与文本不同,文本标记序列是确定性的,而离散音频标记可能基于上下文因素产生显著的变异性,同时仍能产生感知上相同的音频片段。我们将这一现象称为\textbf{离散表示不一致(DRI)}。这种不一致性可能导致单个音频片段由多个差异化的序列表示,从而在神经编解码器语言模型中造成混淆,导致语音生成中的遗漏和重复。本文在流行的音频标记化器如EnCodec中对DRI现象进行了量化分析。我们的方法有效缓解了神经音频编解码器的DRI现象。 Furthermore, extensive experiments on the neural codec language model over LibriTTS and large-scale MLS datases (44,000 hours) demonstrate the effectiveness and generality of our method. The demo of audio samples is available online~\footnote{\url{https://consistencyinneuralcodec.github.io}}。
引用
@article{arxiv.2409.19283,
title = {Analyzing and Mitigating Inconsistency in Discrete Audio Tokens for Neural Codec Language Models},
author = {Wenrui Liu and Zhifang Guo and Jin Xu and Yuanjun Lv and Yunfei Chu and Zhou Zhao and Junyang Lin},
journal= {arXiv preprint arXiv:2409.19283},
year = {2024}
}
备注
e.g.: 15 pages, 4 figures