中文

假说说话者识别:部分假说音频中的“何时假说”

音频与语音处理 2024-06-13 v1 计算与语言 声音

摘要

本文定义了假说说话者识别(Spoof Diarization)作为部分假说(PS)情景下的新任务。旨在确定何时使用何种假说方法,这不仅包括定位假说区域,还包括根据不同假说方法对其进行聚类。作为该任务的开创性研究,我们聚焦于定义任务、建立评估指标和提出一种基准模型,即 Countermeasure-Condition Clustering(3C)模型。利用该模型,我们首先探讨了如何有效训练反掩装置以支持假说说话者识别,采用三种标记方案。随后,我们利用假说定位预测来增强说话者识别性能。该研究揭示了该任务的高度复杂性,即便在仅考虑每个音频文件单个说话者且假说方法数量为 oracle 情形的受限场景下亦然。我们的代码已公开于 https://github.com/nii-yamagishilab/PartialSpoof。

关键词

引用

@article{arxiv.2406.07816,
  title  = {Spoof Diarization: "What Spoofed When" in Partially Spoofed Audio},
  author = {Lin Zhang and Xin Wang and Erica Cooper and Mireia Diez and Federico Landini and Nicholas Evans and Junichi Yamagishi},
  journal= {arXiv preprint arXiv:2406.07816},
  year   = {2024}
}

备注

Accepted to Interspeech 2024