中文

基于嵌入的分类器用于区分真实与合成超分辨音频样本

音频与语音处理 2026-01-08 v1 人工智能 声音 信号处理

摘要

生成对抗网络(GANs)和扩散模型最近在音频超分辨率(ADSR)方面取得了最先进的性能,能够从窄带输入生成感官上令人信服的宽带音频。然而,现有的评估主要依赖信号级或主观指标,仍未回答合成超分辨音频与真实宽带音频分布接近程度的问题。本文通过分析不同嵌入空间中真实与超分辨音频的可分离性来解决这一问题。我们考虑了语音和音乐的中频(4164\to 16~kHz)和全频(164816\to 48~kHz)升频任务,训练线性分类器基于多种类型的音频嵌入来区分真实与合成样本。与客观指标和主观听觉测试结果的比较表明,嵌入基方法在生成音频获得高感官质量和最先进指标分数时,仍能实现近乎完美的分离。这一行为在数据集和模型(包括最新基于扩散的方法)中保持一致,凸显了ADSR模型在感官质量与真实分布保真度之间仍存的持久差距。

关键词

引用

@article{arxiv.2601.03443,
  title  = {Discriminating real and synthetic super-resolved audio samples using embedding-based classifiers},
  author = {Mikhail Silaev and Konstantinos Drossos and Tuomas Virtanen},
  journal= {arXiv preprint arXiv:2601.03443},
  year   = {2026}
}

备注

Accepted for publication in Workshop Proceedingsof the 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing