中文

PartialSpoof 数据库及用于检测话语中嵌入的短假语音片段的对抗措施

音频与语音处理 2023-02-07 v3 密码学与安全 声音

摘要

自动说话人验证易受各种操纵和欺骗的影响,例如文本到语音合成、语音转换、重放、篡改、对抗攻击等。我们考虑一种称为“部分欺骗”(Partial Spoof, PS)的新欺骗场景,其中合成或变换的语音片段被嵌入到真实话语中。虽然现有的对抗措施(CMs)可以检测完全欺骗的话语,但有必要对其进行适配或扩展以应用于 PS 场景。我们提出多种改进,以构建显著更精确的 CM,能够在更细的时间分辨率下检测并定位短生成的欺骗语音片段。首先,我们引入新开发的自我监督预训练模型作为增强的特征提取器。其次,我们通过添加各种时间分辨率的片段标签来扩展我们的 PartialSpoof 数据库。由于攻击者嵌入的短欺骗语音片段长度可变,我们考虑了六种不同的时间分辨率,范围从短至 20 ms 到长达 640 ms。第三,我们提出一种新的 CM,能够同时利用不同时间分辨率的片段级标签以及话语级标签,以同时执行话语级和片段级检测。我们还表明,所提出的 CM 能够在 PS 场景以及相关的逻辑访问(LA)场景中以低错误率检测欺骗。在 PartialSpoof 数据库和 ASVspoof 2019 LA 数据库上话语级检测的等错误率分别为 0.77% 和 0.90%。

关键词

引用

@article{arxiv.2204.05177,
  title  = {The PartialSpoof Database and Countermeasures for the Detection of Short Fake Speech Segments Embedded in an Utterance},
  author = {Lin Zhang and Xin Wang and Erica Cooper and Nicholas Evans and Junichi Yamagishi},
  journal= {arXiv preprint arXiv:2204.05177},
  year   = {2023}
}

备注

Published in IEEE/ACM Transactions on Audio, Speech, and Language Processing (DOI: 10.1109/TASLP.2022.3233236)