中文

面向跨语言语音防伪的语言不匹配效应量化与降低

音频与语音处理 2024-10-22 v1 人工智能 计算与语言 声音

摘要

语言不匹配效应影响语音防伪系统,但对这些效应的调查与量化仍有限。现有防伪数据集主要为英语,获取多语言数据集的高成本阻碍了训练语言无关模型的工作。我们启动此项工作,通过评估在英语数据上训练但在其他语言上测试的顶尖语音防伪系统,观察到显著的性能下降。我们提出了一种创新方法——基于 TTS 的音调数据扩展(ACCENT),通过引入多样化语言知识来增强单语言训练模型的跨语言能力。我们在大型数据集上进行实验,包含超过 300 万样本,其中 180 万用于训练,近 120 万用于测试,覆盖 12 个语言。通过应用所提出的 ACCENT 方法,语言不匹配效应 Preliminary 量化并在 15% 以上得到显著降低。该易于实施的方法在多语言和低资源语言场景中展现出广阔前景。

关键词

引用

@article{arxiv.2409.08346,
  title  = {Towards Quantifying and Reducing Language Mismatch Effects in Cross-Lingual Speech Anti-Spoofing},
  author = {Tianchi Liu and Ivan Kukanov and Zihan Pan and Qiongqiong Wang and Hardik B. Sailor and Kong Aik Lee},
  journal= {arXiv preprint arXiv:2409.08346},
  year   = {2024}
}

备注

Accepted to the IEEE Spoken Language Technology Workshop (SLT) 2024