假说说话者识别:部分假说音频中的“何时假说”
音频与语音处理
2024-06-13 v1 计算与语言
声音
摘要
本文定义了假说说话者识别(Spoof Diarization)作为部分假说(PS)情景下的新任务。旨在确定何时使用何种假说方法,这不仅包括定位假说区域,还包括根据不同假说方法对其进行聚类。作为该任务的开创性研究,我们聚焦于定义任务、建立评估指标和提出一种基准模型,即 Countermeasure-Condition Clustering(3C)模型。利用该模型,我们首先探讨了如何有效训练反掩装置以支持假说说话者识别,采用三种标记方案。随后,我们利用假说定位预测来增强说话者识别性能。该研究揭示了该任务的高度复杂性,即便在仅考虑每个音频文件单个说话者且假说方法数量为 oracle 情形的受限场景下亦然。我们的代码已公开于 https://github.com/nii-yamagishilab/PartialSpoof。
引用
@article{arxiv.2406.07816,
title = {Spoof Diarization: "What Spoofed When" in Partially Spoofed Audio},
author = {Lin Zhang and Xin Wang and Erica Cooper and Mireia Diez and Federico Landini and Nicholas Evans and Junichi Yamagishi},
journal= {arXiv preprint arXiv:2406.07816},
year = {2024}
}
备注
Accepted to Interspeech 2024