中文

神经语音与音频编码:现代AI技术与传统编解码器的融合

声音 2025-01-08 v2 人工智能 音频与语音处理 信号处理

摘要

本文探讨了模型驱动方法与数据驱动方法在神经语音与音频编码系统中的集成。文章概述了语音与音频编解码器主观评估过程的挑战,以及纯数据驱动方法的局限性——这些方法往往需要高效能不足以匹配模型驱动方法的大型架构。研究表明,混合系统是可行的解决方案,显著改进了传统编解码器的性能,通过精心选定的设计增强。具体而言,本文引入了基于神经网络的信令增强器,用于后处理现有编解码器的输出,以及基于自编码器的端到端模型和LPCNet——混合系统将线性预测编码 (LPC) 与神经网络结合。此外,本文深入研究了在自定义特征空间中运行的预测模型(TF-Codec)或预定义变换域中的预测模型(MDCTNet),并检查了使用精神听觉校准损失函数训练端到端神经音频编解码器。通过这些调查,本文展示了混合系统在桥接传统模型驱动方法与现代数据驱动技术方面的潜力,以推动语音与音频编码领域的发展。

关键词

引用

@article{arxiv.2408.06954,
  title  = {Neural Speech and Audio Coding: Modern AI Technology Meets Traditional Codecs},
  author = {Minje Kim and Jan Skoglund},
  journal= {arXiv preprint arXiv:2408.06954},
  year   = {2025}
}

备注

Published in IEEE Signal Processing Magazine