用于定位部分假音中操纵区域的无监督域适应方法
声音
2024-07-12 v1 机器学习
音频与语音处理
摘要
在跨域数据集中定位部分假音 (PFA) 中的操纵区域时,深度学习模型的性能会因源域与目标域之间的差异而显著下降。为解决此问题,现有方法通常在训练前进行数据增强,但忽略了目标域中源域所缺乏的特征。灵感来源于 mixture-of-experts 模型,我们提出一种无监督方法,称为样本矪采矿与熵 (SDE)。我们首先从一组在源域中表现优异但对目标样本模糊的 diverse experts 中进行学习。我们利用这些 diverse experts 通过计算其熵值来挑选最具信息性的样本。进一步地,我们针对这些所选样本引入一种量身定制的标签生成方法,并将其融入源域训练过程中,集成目标域信息。我们将该方法应用于跨域部分假音检测数据集 ADD2023Track2。通过引入 10% 来自目标域的未知样本,我们实现了 43.84% 的 F1 分数,这相当于相对于第二名方法的提升 77.2%。
关键词
引用
@article{arxiv.2407.08239,
title = {An Unsupervised Domain Adaptation Method for Locating Manipulated Region in partially fake Audio},
author = {Siding Zeng and Jiangyan Yi and Jianhua Tao and Yujie Chen and Shan Liang and Yong Ren and Xiaohui Zhang},
journal= {arXiv preprint arXiv:2407.08239},
year = {2024}
}