HCFD:面向医疗保健领域的音频深度伪造检测基准
音频与语音处理
2026-04-21 v1
摘要
本研究提出Healthcare Codec-Fake Detection (HCFD),是一个用于检测病理语音条件下codec伪造的新任务。我们有意聚焦于基于codec的合成语音,因为神经codec解码是现代语音生成管道中的核心组件。首先,我们发布Healthcare CodecFake,这是首个包含多临床条件和多种codec族中成对的真实语音与NAC合成语音的病理感知数据集。我们的评估表明,主要在健康语音上训练的SOTA codec伪造检测器在Healthcare CodecFake上表现不佳,凸显HCFD特定模型的必要性。其次,我们证明PaSST在HCFD任务中优于现有语音模型,受益于其基于patch的时频表示。最后,我们提出PHOENIX-Mamba,一种几何感知框架,将codec伪造建模为在双曲空间中自我发现的多个模式,实现了在HCFD任务中跨临床条件和codec的最强性能。在HCFK数据集上实验表明,PHOENIX-Mamba (PaSST) 在E-Dep上达到97.04%准确率,在E-Alz上达到96.73%,在E-Dys上达到96.57%,而在中文上保持强劲表现:Dep为94.41%,Alz为94.40%,Dys为93.20%。这种几何感知表述使我们能够在双曲空间中实现对异构codec伪造模式的自组织聚类,从而在病理语音变异性下实现稳健的判别。PHOENIX-Mamba 在临床条件和codec方面实现了HCFD任务的最佳性能。
引用
@article{arxiv.2604.17642,
title = {HCFD: A Benchmark for Audio Deepfake Detection in Healthcare},
author = {Mohd Mujtaba Akhtar and Girish and Muskaan Singh},
journal= {arXiv preprint arXiv:2604.17642},
year = {2026}
}
备注
Accepted to ACL 2026