面向异步语音匿名化的说话人嵌入感知不一致性调查
音频与语音处理
2025-10-08 v1
摘要
给定语音生成框架以嵌入向量表示说话人属性,异步语音匿名化可通过修改源语音派生的说话人嵌入来实现。然而,语音生成框架中机器与人类对说话人属性感知的不一致性尚未被探讨,限制了其在异步语音匿名化中的性能。为此,本研究通过修改语音生成过程中的说话人嵌入来探讨此不一致性。在 FACodec 和 Diff-HierVC 语音生成模型实验中发现,存在一个子空间,其移除会改变机器对说话人属性的感知,同时保留其人类对生成语音中说话人属性的感知。基于上述发现,开发了一种异步语音匿名化方法,实现了 100%的人类感知保持率,同时遮蔽机器感知。音频样本可在 https://voiceprivacy.github.io/speaker-embedding-eigen-decomposition/ 查看。
引用
@article{arxiv.2510.05718,
title = {Investigation of perception inconsistency in speaker embedding for asynchronous voice anonymization},
author = {Rui Wang and Liping Chen and Kong Aik Lee and Zhengpeng Zha and Zhenhua Ling},
journal= {arXiv preprint arXiv:2510.05718},
year = {2025}
}