多说话人匿名化基准
声音
2025-03-28 v2 计算与语言
音频与语音处理
摘要
隐私保留式语音保护方法主要抑制由语料属性所衍生的与隐私相关信息,同时保留语言内容。现有解决方案特别关注单说话人场景,但缺乏针对实际应用中多说话人场景的实用性。本文提出首次提供多说话人匿名化基准的尝试,通过定义任务和评估协议、提出基准解决方案并讨论重叠对话中的隐私泄露。所提基准解决方案基于级联系统集成,包含基于谱聚类的说话人分割和基于消除的说话人匿名化,使用选择式匿名器。为提高实用性,基准解决方案进一步通过两种对话级别的说话人向量匿名化方法得到增强。第一种方法最小化原始对话和匿名化对话中说话人对之间的差异,从而保持匿名化版本中的原始说话人关系。另一种方法最小化匿名化说话人之间的聚合相似性,从而实现说话人之间的更好区分度。在非重叠模拟数据集和真实世界数据集上进行的实验表明,所提出的多说话人匿名化系统配合所提出的说话人匿名器具有有效性。此外,我们分析了重叠语音的隐私泄露问题并提供了潜在解决方案。
引用
@article{arxiv.2407.05608,
title = {A Benchmark for Multi-speaker Anonymization},
author = {Xiaoxiao Miao and Ruijie Tao and Chang Zeng and Xin Wang},
journal= {arXiv preprint arXiv:2407.05608},
year = {2025}
}
备注
Accepted by TIFS