中文

语音深度伪造的法医学相似性

声音 2026-05-07 v2

摘要

本文提出了语音深度伪造检测领域的法医学相似性概念,旨在确定两个音频段是否共享相同的底层法医痕迹。我们的做法灵感来自图像领域的 prior work。为了将这一思想转移到音频领域,我们提出了一个由基于Siamese的特征提取器和核心决策模块组成的两阶段深度学习框架,称为相似性网络。该系统旨在通过比较其法医特征来评估两个语音样本是否来自同一来源。在实际中,模型将音频段的对映射到表示其是否包含相同或不同法医痕迹的相似性得分。我们在新兴的源验证任务上评估了所提出的方法,展示了其确定两个语音样本是否由同一模型生成的能力。此外,我们探索了其对音频剪切检测的适用性作为一种补充用例。实验结果表明,所提出的方法对以前未见过的法医痕迹具有良好的泛化能力,突显了其在数字音频法医学中的鲁棒性、灵活性和实际相关性。

关键词

引用

@article{arxiv.2510.02864,
  title  = {Forensic Similarity for Speech Deepfakes},
  author = {Viola Negroni and Davide Salvi and Daniele Ugo Leonzio and Paolo Bestagini and Stefano Tubaro},
  journal= {arXiv preprint arXiv:2510.02864},
  year   = {2026}
}

备注

Accepted @ ACM IH&MMSec 2026