中文

LENS-DF:面向长格式含噪语音的深度伪造检测与时序定位

声音 2025-07-25 v2 密码学与安全 音频与语音处理

摘要

本研究引入了 LENS-DF,一种在复杂且真实的音频条件下训练和评估音频深度伪造检测与时序定位的新型综合性方案。该方案的生成部分以可控方式从输入数据集中输出具有若干关键特征的音频,如持续时间更长、含噪条件以及包含多个说话人。相应的检测与定位协议使用模型。我们基于自监督学习前端和简单后端进行实验。结果表明,使用 LENS-DF 生成的数据训练的模型始终优于通过传统方案训练的模型,证明了 LENS-DF 在鲁棒音频深度伪造检测与定位方面的有效性和实用性。我们还对引入的变体进行了消融研究,探讨了它们对该领域实际挑战的影响与相关性。

关键词

引用

@article{arxiv.2507.16220,
  title  = {LENS-DF: Deepfake Detection and Temporal Localization for Long-Form Noisy Speech},
  author = {Xuechen Liu and Wanying Ge and Xin Wang and Junichi Yamagishi},
  journal= {arXiv preprint arXiv:2507.16220},
  year   = {2025}
}

备注

Accepted by IEEE International Joint Conference on Biometrics (IJCB) 2025, Osaka, Japan