基于自注意力伪造片段发现的局部伪造音频检测
音频与语音处理
2022-02-16 v2 机器学习
声音
摘要
过去几年中,语音合成与语音转换技术取得了显著进展。然而,此类技术可能削弱广泛部署的生物特征识别模型的鲁棒性,并被现实中的攻击者用于非法用途。ASVspoof 挑战主要关注由先进语音合成与语音转换模型合成的音频,以及重放攻击。最近,首届音频深度合成检测挑战赛(ADD 2022)将攻击场景扩展到了更多方面。ADD 2022 也是首个提出局部伪造音频检测任务的挑战赛。此类全新攻击具有危险性,如何应对这类攻击仍是一个开放问题。因此,我们提出了一种新颖的框架,通过引入带有自注意力机制的问答(伪造片段发现)策略来检测局部伪造音频。所提出的伪造片段检测模块要求反欺骗模型预测局部伪造音频中伪造片段的起始与结束位置,将模型的注意力引导至发现伪造片段而非其他泛化能力较弱的捷径,并最终赋予模型区分真实与局部伪造音频的能力。我们的提交在 ADD 2022 的局部伪造音频检测赛道中排名第二。
引用
@article{arxiv.2202.06684,
title = {Partially Fake Audio Detection by Self-attention-based Fake Span Discovery},
author = {Haibin Wu and Heng-Cheng Kuo and Naijun Zheng and Kuo-Hsuan Hung and Hung-Yi Lee and Yu Tsao and Hsin-Min Wang and Helen Meng},
journal= {arXiv preprint arXiv:2202.06684},
year = {2022}
}
备注
Submitted to ICASSP 2022