基于奇异值变换辅助矩阵的独特且自然说话人匿名化
音频与语音处理
2024-05-20 v1
摘要
说话人匿名化是一种有效的隐私保护解决方案,旨在隐藏说话人的身份,同时保持原始语音的自然性和辨识度。主流方法使用来自预训练自动说话人验证 (ASV) 模型的 utterance 级别向量表示说话人身份,然后对其进行平均或修改以实现匿名化。然而,这些系统会导致匿名化语音的自然性下降、说话人辨识度退化以及对强大攻击者的严重隐私泄露。为解决这些问题,尤其是生成更自然且更具辨识度的匿名化语音,我们提出了一种新颖的说话人匿名化方法,通过奇异值变换辅助矩阵来建模与说话人身份相关的矩阵并进行变换以隐藏原始说话人身份。我们的方法从预训练的 ASV 模型中提取帧级说话人向量,并利用注意力机制创建说话人评分矩阵和说话人相关标记。值得注意的是,说话人评分矩阵作为相应说话人相关标记的权重,代表了说话人的身份。通过奇异值分解 (SVD) 生成奇异值变换辅助矩阵。针对 VoicePrivacy 挑战数据集上的实验表明,我们的方法在所有攻击情景下均能有效保护说话人隐私,同时保持语音的自然性和辨识度。
引用
@article{arxiv.2405.10786,
title = {Distinctive and Natural Speaker Anonymization via Singular Value Transformation-assisted Matrix},
author = {Jixun Yao and Qing Wang and Pengcheng Guo and Ziqian Ning and Lei Xie},
journal= {arXiv preprint arXiv:2405.10786},
year = {2024}
}
备注
Accepted by IEEE/ACM Transactions on Audio, Speech, and Language Processing