面向音频深度伪造检测的提示调优:计算高效的测试时域适应方法
声音
2024-10-15 v1 人工智能
密码学与安全
机器学习
音频与语音处理
摘要
我们研究面向音频深度伪造检测(ADD)的测试时域适应问题,既要解决(i)源域-目标域差异,又要应对(ii)目标数据集尺寸有限,以及(iii)计算成本高的问题。我们提出一种 ADD 方法,采用插件式的提示调优技术。该方法通过无缝集成最新 transformer 模型和/或其他微调方法,实现了在目标数据上的性能提升,从而解决挑战(i)。此外,我们的方法能够适应小规模目标数据集,因为无需额外大量参数(挑战(ii))。这一特征也有助于提高计算效率,抵消了在 ADD 中大规模预训练模型通常伴随的高计算成本(挑战(iii))。我们得出结论,针对 ADD 的提示调优在数据有限且计算开销可忽略的情况下,为增强准确率提供了可行路径。
引用
@article{arxiv.2410.09869,
title = {Prompt Tuning for Audio Deepfake Detection: Computationally Efficient Test-time Domain Adaptation with Limited Target Dataset},
author = {Hideyuki Oiso and Yuto Matsunaga and Kazuya Kakizaki and Taiki Miyagawa},
journal= {arXiv preprint arXiv:2410.09869},
year = {2024}
}
备注
Accepted at Interspeech 2024. Hideyuki Oiso and Yuto Matsunaga contributed equally