联合全频带-子频带建模的高分辨率歌声伪造检测
声音
2026-04-07 v1 音频与语音处理
信号处理
摘要
歌唱语音合成技术的快速发展增加了未经授权的模仿风险,催生了对更好歌声深度伪造检测(SingFake Detection,简称 SVDD)的迫切需求。与语音不同,歌唱包含复杂的音高、宽动态范围和音色变化。传统的 16 kHz 采样检测器被证明不足,因为它们丢弃了关键的高频信息。本研究首次对高分辨率(44.1 kHz 采样率)音频在 SVDD 中的应用进行了系统性分析。我们提出了一种联合全频带-子频带建模框架:全频带捕获全局上下文,而子频带专用专家分离出频谱中分布不均的细粒度合成伪影。在 WildSVDD 数据集上的实验表明,高频子频带提供了关键的互补线索。我们的框架显著优于 16 kHz 采样模型,证明了高分辨率音频和策略性子频带集成对于鲁棒的野外检测至关重要。
引用
@article{arxiv.2604.04841,
title = {Joint Fullband-Subband Modeling for High-Resolution SingFake Detection},
author = {Xuanjun Chen and Chia-Yu Hu and Sung-Feng Huang and Haibin Wu and Hung-yi Lee and Jyh-Shing Roger Jang},
journal= {arXiv preprint arXiv:2604.04841},
year = {2026}
}
备注
Submitted to INTERSPEECH 2026