中文

基于多阶谱图融合-重构学习的鲁棒音频反欺骗方法

声音 2024-10-04 v1 人工智能 多媒体 音频与语音处理

摘要

由于深度伪造技术的最新进展,鲁棒音频反欺骗变得愈发具有挑战性。尽管谱图已展现出反欺骗能力,但多阶谱模式中呈现的互补信息尚未被充分挖掘,限制了其对多变欺骗攻击的有效性。因此,我们提出一种具有谱融合-重构策略的新型深度学习方法,即S2pecNet,以利用多阶谱模式获得鲁棒音频反欺骗表征。具体而言,至多二阶的谱模式以由粗到细方式融合,并设计双分支从谱与时域上下文进行细粒度融合。从融合表征到输入谱图的重构进一步减少了潜在的融合信息损失。我们的方法在广泛使用的数据集ASVspoof2019 LA Challenge上以0.77%的EER取得了最先进性能。

关键词

引用

@article{arxiv.2308.09302,
  title  = {Robust Audio Anti-Spoofing with Fusion-Reconstruction Learning on Multi-Order Spectrograms},
  author = {Penghui Wen and Kun Hu and Wenxi Yue and Sen Zhang and Wanlei Zhou and Zhiyong Wang},
  journal= {arXiv preprint arXiv:2308.09302},
  year   = {2024}
}