中文

语音合成中说话人相似度评估的分析与改进

声音 2025-07-04 v1 计算与语言 机器学习 音频与语音处理

摘要

由于声音身份的多面性,对其进行建模极具挑战性。在生成式语音系统中,身份通常使用自动说话人验证(ASV)嵌入进行评估,这些嵌入是为区分而非表征身份而设计的。本文研究了此类表示中捕获了声音的哪些方面。我们发现,广泛使用的 ASV 嵌入主要关注音色和音高等静态特征,而忽略了节奏等动态要素。我们还识别了影响说话人相似度测量的混淆因素,并提出了缓解策略。为了解决这些不足,我们提出了 U3D,一种评估说话人动态节奏模式的指标。这项工作有助于应对在语音克隆系统日益完善的背景下评估说话人身份一致性的持续挑战。我们公开发布了我们的代码。

关键词

引用

@article{arxiv.2507.02176,
  title  = {Analyzing and Improving Speaker Similarity Assessment for Speech Synthesis},
  author = {Marc-André Carbonneau and Benjamin van Niekerk and Hugo Seuté and Jean-Philippe Letendre and Herman Kamper and Julian Zaïdi},
  journal= {arXiv preprint arXiv:2507.02176},
  year   = {2025}
}

备注

Accepted at SSW13 - Interspeech 2025 Speech Synthesis Workshop