中文

基于 ENF 时空特征表示学习的数字音频篡改检测

声音 2022-08-26 v1 音频与语音处理

摘要

大多数基于电网频率(ENF)的数字音频篡改检测方法仅利用 ENF 的静态空间信息,忽略了 ENF 在时序上的变化,限制了 ENF 特征表示能力并降低了篡改检测准确率。本文提出一种基于 ENF 时空特征表示学习的数字音频篡改检测新方法。利用 CNN 与 BiLSTM 构建并行时空网络模型,深度提取 ENF 空间特征信息与 ENF 时间特征信息,以增强特征表示能力从而提高篡改检测准确率。为提取 ENF 的时空特征,本文首先采用数字音频高精度离散傅里叶变换分析提取 ENF 的相位序列;将不等长相位序列通过自适应帧移分帧,获得相同尺寸的特征矩阵以表示 ENF 空间特征;同时基于 ENF 时间变化信息对相位序列分帧以表示 ENF 时间特征。随后分别使用 CNN 与 BiLSTM 进一步提取深度空间与时间特征,并采用注意力机制对深度时空特征自适应赋权,获得表示能力更强的时空特征。最后利用深度神经网络判定音频是否被篡改。实验结果表明,在公开数据库 Carioca、New Spanish 下,所提方法相较 SOTA 方法准确率提升 2.12%–7.12%。

关键词

引用

@article{arxiv.2208.11920,
  title  = {Digital Audio Tampering Detection Based on ENF Spatio-temporal Features Representation Learning},
  author = {Chunyan Zeng and Shuai Kong and Zhifeng Wang and Xiangkui Wan and Yunfan Chen},
  journal= {arXiv preprint arXiv:2208.11920},
  year   = {2022}
}

备注

19 pages, 6 figures