通过神经元级置换与神经可塑性机制提升深度伪造音频检测的效率与性能
声音
2026-03-27 v2 人工智能
摘要
当前音频深度伪造检测已通过多样化深度学习架构(如 ResNet)实现显著性能,大型模型(LMs)如 Wav2Vec 的引入进一步推动了改进。大型语言模型(LLMs)的成功进一步证明了参数规模扩张的优势,但也凸显了性能增长受参数个数限制的瓶颈。仅堆叠额外层(如当前 LLM 所做)计算成本高昂且需完整再训练。此外,现有低秩适应方法主要应用于注意力机制架构,限制了其适用范围。灵感来自哺乳动物大脑中观察到的神经可塑性,我们提出了 novel 的 dropin 与 further plasticity 算法,通过动态调整特定层的神经元数量来灵活调制模型参数。我们在多个架构上进行评估,包括 ResNet、Gated 循环神经网络和 Wav2Vec。使用广泛认可的 ASVSpoof2019 LA、PA 和 FakeorReal 数据集实验结果表明,dropin 方法在计算效率上实现一致性改进,dropin 与 plasticity 方法分别在这些数据集上将 Equal Error Rate 降低约 39% 和 66%。代码与补充材料已提供于 Github 链接。
引用
@article{arxiv.2603.24343,
title = {Enhancing Efficiency and Performance in Deepfake Audio Detection through Neuron-level Dropin & Neuroplasticity Mechanisms},
author = {Yupei Li and Shuaijie Shao and Manuel Milling and Björn Schuller},
journal= {arXiv preprint arXiv:2603.24343},
year = {2026}
}
备注
Accepted at IJCNN 2026