中文

面向稳健语音深度伪造检测的人类启发式推理

声音 2026-03-13 v2 人工智能

摘要

现代生成式音频模型可被用于非法目的,具体而言,是用于冒充他人获取私人信息。为缓解此问题,语音深度伪造检测(SDD)方法不断发展。然而,当前的 SDD 方法通常存在对新音频领域和新生成器的泛化能力不足的问题。此外,它们缺乏可解释性,尤其是人类类似的推理,这会自然解释给定音频归属真实或伪造类的归因,并提供人类可感知的线索。在本文中,我们提出 HIR-SDD,一个新型 SDD 框架,结合大型音频语言模型(LALM)的优势与来自我们提出的人类标注数据集中获得的链式思维推理。实验评估表明,我们提出的方法有效且能够为预测提供合理的依据。

关键词

引用

@article{arxiv.2603.10725,
  title  = {Towards Robust Speech Deepfake Detection via Human-Inspired Reasoning},
  author = {Artem Dvirniak and Evgeny Kushnir and Dmitrii Tarasov and Artem Iudin and Oleg Kiriukhin and Mikhail Pautov and Dmitrii Korzh and Oleg Y. Rogov},
  journal= {arXiv preprint arXiv:2603.10725},
  year   = {2026}
}