Codec2Vec:基于神经语音编解码器的自监督语音表示学习
音频与语音处理
2025-11-21 v1 计算与语言
摘要
近期神经音频编解码器的进展不仅促进了语音合成技术,还增强了语音合成效果。研究人员正在探索其作为通用声学特征提取器以适用于更广泛的语音处理任务的潜力。基于这一趋势,我们引入Codec2Vec,这是首个完全依赖离散音频编解码器单元的语音表示学习框架。该方法具有若干优势,包括改进的数据存储和传输效率、更快的训练速度以及增强的数据隐私。我们探索了多种训练目标派生策略以充分理解该框架的有效性。在SUPERB基准测试中,Codec2Vec在保持存储需求降低最高可达16.5倍、训练时间缩短2.3倍的同时,实现了与连续输入模型相当的性能,展示了其可扩展性和效率。
引用
@article{arxiv.2511.16639,
title = {Codec2Vec: Self-Supervised Speech Representation Learning Using Neural Speech Codecs},
author = {Wei-Cheng Tseng and David Harwath},
journal= {arXiv preprint arXiv:2511.16639},
year = {2025}
}
备注
To be presented at ASRU 2025