平滑频谱分解用于神经网络音频编解码器
声音
2025-10-07 v1 音频与语音处理
神经元与认知
摘要
虽然基于神经网络的模型在音频特征提取方面取得了显著进展,但已学习表示的可解释性仍然是一个关键挑战。为此,已将解缠技术集成到离散神经网络音频编解码器中,以在提取的标记上施加结构。然而,这些方法常常对特定数据集或任务公式表现出强烈依赖。在本工作中,我们提出了一种利用时域信号谱分解来增强表示可解释性的解缠神经网络音频编解码器。实验评估表明,我们的方法在重建保真度和感知质量方面均优于最新基线。
引用
@article{arxiv.2510.03741,
title = {D\'esentrelacement Fr\'equentiel Doux pour les Codecs Audio Neuronaux},
author = {Benoît Giniès and Xiaoyu Bie and Olivier Fercoq and Gaël Richard},
journal= {arXiv preprint arXiv:2510.03741},
year = {2025}
}
备注
in French language, Groupe de Recherche et d'Etudes du Traitement du Signal et des Images (GRETSI 2025), Aug 2025, Strasbourg, France