中文

面向无约束音频拼接检测与定位的神经网络方法

声音 2024-05-06 v4 人工智能 计算机视觉与模式识别 音频与语音处理

摘要

免费且易用的音频编辑工具使得音频拼接变得轻而易举。通过组合同一人的不同语音样本即可制造令人信服的伪造音频。在涉及虚假信息的公共部门以及验证证据完整性的法律语境中,此类拼接的检测都十分重要。遗憾的是,大多数现有的音频拼接检测算法使用手工特征并做出特定假设。然而,刑事调查人员常面临来自无约束来源、特征未知的音频样本,这就亟需更具普适性的方法。本工作旨在朝无约束音频拼接检测迈出第一步以应对该需求。我们以可能掩盖拼接的后处理操作形式模拟了多种攻击场景。我们提出了一种用于拼接检测与定位的 Transformer 序列到序列(seq2seq)网络。我们广泛的评估表明,所提方法优于现有的专用拼接检测方法 [3, 10] 以及通用网络 EfficientNet [28] 和 RegNet [25]。

关键词

引用

@article{arxiv.2207.14682,
  title  = {Towards Unconstrained Audio Splicing Detection and Localization with Neural Networks},
  author = {Denise Moussa and Germans Hirsch and Christian Riess},
  journal= {arXiv preprint arXiv:2207.14682},
  year   = {2024}
}

备注

Published at MMFORWILD 2022, ICPR Workshops - Code: https://faui1-gitlab.cs.fau.de/denise.moussa/audio-splicing-localization . International Conference on Pattern Recognition. Cham: Springer Nature Switzerland, 2022