中文

基于嵌入的高效时序深度伪造定位方法用于部分伪造音频检测

声音 2023-11-22 v2 人工智能 音频与语音处理

摘要

部分伪造音频检测是一项具有挑战性的任务,其难点在于需要在帧级别准确判定音频的真伪。为解决此问题,我们提出了一种细粒度的部分伪造音频检测方法,即时序深度伪造定位(TDL),其能有效捕获特征与位置信息。具体而言,我们的方法包含两个新颖部分:嵌入相似度模块与时序卷积操作。为增强真实与伪造特征间的辨识度,嵌入相似度模块被设计用于生成一个可将真实帧与伪造帧分离的嵌入空间。为有效聚焦于位置信息,提出时序卷积操作以计算相邻帧间的帧特定相似度,并动态选择信息丰富的邻居进行卷积。大量实验表明,我们的方法在ASVspoof2019 Partial Spoof数据集上优于基线模型,并且在跨数据集场景下也展现出优越性能。

关键词

引用

@article{arxiv.2309.03036,
  title  = {An Efficient Temporary Deepfake Location Approach Based Embeddings for Partially Spoofed Audio Detection},
  author = {Yuankun Xie and Haonan Cheng and Yutian Wang and Long Ye},
  journal= {arXiv preprint arXiv:2309.03036},
  year   = {2023}
}