神经编解码器重绪合的深入探讨:连接编解码器与波形生成之间的鸿沟
音频与语音处理
2024-10-31 v1 计算与语言
机器学习
声音
摘要
神经音频编解码器最初设计为压缩技术,近期因其在语音生成方面的潜力受到广泛关注。编解码器模型将每个音频帧表示为离散嵌入序列,即离散词元。神经编解码器的离散性和低频特性引入了一种基于词元的语音生成方式。由于这些词元以不同粒度(从粗到细)编码信息,现有大多数研究聚焦于如何更好地生成粗粒度词元。本文关注一个同样重要但常被忽视的问题:如何更好地从粗粒度词元重绪合波形?我们指出,学习目标的选择和重绪合方法对生成音频质量具有决定性影响。具体而言,我们研究了两种基于词元预测和回归的策略,并引入了基于薛定谔桥的方法。我们检验了不同设计选择对机器感知和人类感知的影响。
引用
@article{arxiv.2410.22448,
title = {A Closer Look at Neural Codec Resynthesis: Bridging the Gap between Codec and Waveform Generation},
author = {Alexander H. Liu and Qirui Wang and Yuan Gong and James Glass},
journal= {arXiv preprint arXiv:2410.22448},
year = {2024}
}
备注
NeurIPS 2024 Audio Imagination workshop paper; demo page at https://alexander-h-liu.github.io/codec-resyn.github.io/