NE-PADD:基于注意力聚合利用命名实体知识的鲁棒性部分音频深度伪造检测
计算与语言
2025-09-05 v1
摘要
与传统的句子级音频深度伪造检测(ADD)不同,部分音频深度伪造检测(PADD)需要对假语音位置进行帧级定位。尽管该领域取得了一些进展,但充分利用音频语义信息,尤其是命名实体,仍是一个被忽略的方面。为此,我们提出了 NE-PADD,这是一种新的部分音频深度伪造检测(PADD)方法,通过两个平行分支利用命名实体知识:语音命名实体识别(SpeechNER)和 PADD。该方法包含两种注意力聚合机制:注意力融合(Attention Fusion, AF)用于组合注意力权重,注意力迁移(Attention Transfer, AT)用于通过辅助损失利用命名实体语义指导 PADD。基于 PartialSpoof-NER 数据集进行实验,结果表明我们的方法在现有基线方法上取得了更好的性能,证明了在 PADD 中集成命名实体知识的有效性。代码已公开于 https://github.com/AI-S2-Lab/NE-PADD。
关键词
引用
@article{arxiv.2509.03829,
title = {NE-PADD: Leveraging Named Entity Knowledge for Robust Partial Audio Deepfake Detection via Attention Aggregation},
author = {Huhong Xian and Rui Liu and Berrak Sisman and Haizhou Li},
journal= {arXiv preprint arXiv:2509.03829},
year = {2025}
}