中文

探究因果线索:利用人类可辨识语言特征强化伪造音频检测

声音 2024-09-11 v1 计算与语言 音频与语音处理

摘要

几类伪造音频,如模仿、回放攻击和深度伪造,已在信息完整性方面造成社会挑战。最近的研究人员与社会语言学专家合作,对伪造音频样本标记为由专家定义的语言特征(EDLFs),这些特征可以被人耳辨认:音高、停顿、辅音的字首和字尾爆发声、可听见的吸气或呼气声,以及整体音频质量。已证实,当将这些EDLFs纳入传统和常见的音频特征时,深度伪造检测算法会有所改进。本文我们使用由多种类型伪造音频组成的混合数据集,包含社会语言学注释,探讨了在可辨识语言特征与音频标签之间的因果发现和推断,比较了因果模型与专家地面真实验证标记过程所得结果的发现。我们的发现表明,因果模型表明纳入语言特征有助于辨识伪造音频,以及整体需要和机会将人类知识纳入模型和技术以加强AI模型。因果发现和推断可用于作为训练人类辨识伪造音频的基础,也可用于自动EDLFs标记,以提高常见AI基于伪造音频检测器的性能。

关键词

引用

@article{arxiv.2409.06033,
  title  = {Investigating Causal Cues: Strengthening Spoofed Audio Detection with Human-Discernible Linguistic Features},
  author = {Zahra Khanjani and Tolulope Ale and Jianwu Wang and Lavon Davis and Christine Mallinson and Vandana P. Janeja},
  journal= {arXiv preprint arXiv:2409.06033},
  year   = {2024}
}