中文

基于音素水平的人-of-Interest 语音深度伪造检测

声音 2025-07-14 v1 音频与语音处理

摘要

近年来生成式 AI 的进展使得语音深度伪造的制作变得广为人知,严重挑战了数字信任。为此已提出 various speech deepfake detection 策略,其中包括 Person-of-Interest (POI) 方法,专注于识别针对特定个体的模仿,通过建模和分析其独特声学特征来实现。尽管这些方法表现出色,但现有方法仅提供有限的细粒度且缺乏可解释性。本文提出一种基于 POI 的语音深度伪造检测方法, operates at the phoneme level。该方法将参考音频分解为音素,以构建详细的说话人轮廓。在推理阶段,对测试样本中的音素逐个与该轮廓进行比较,从而实现对人造痕迹的细粒度检测。该方法在准确率上与传统方法相当,同时在鲁棒性和可解释性方面具有优势,这些都是多媒体法医学中的关键方面。通过聚焦于音素分析,本工作探索了一种新颖的、以说话人为中心的可解释深度伪造检测方向。

关键词

引用

@article{arxiv.2507.08626,
  title  = {Phoneme-Level Analysis for Person-of-Interest Speech Deepfake Detection},
  author = {Davide Salvi and Viola Negroni and Sara Mandelli and Paolo Bestagini and Stefano Tubaro},
  journal= {arXiv preprint arXiv:2507.08626},
  year   = {2025}
}

备注

Accepted at ICCV Workshop - Authenticity & Provenance in the age of Generative AI