情感风格潜伏于深度说话人嵌入中:用于说话人聚类的数据 disentanglement
声音
2025-09-30 v1 音频与语音处理
摘要
说话人聚类是识别一组音频记录中唯一说话人的任务(每个记录恰好属于一个说话人),而不知道整个数据中存在哪些说话人及其数量,这是说话人分割过程的必需步骤。最近,利用即插即用深度说话人嵌入模型来捕获说话人特征。然而,包含情感表达的语音提出了重大挑战,常常影响说话人嵌入的准确性,导致说话人聚类性能下降。为解决此问题,我们提出了 DTG-VAE,这是一种新颖的disentanglement方法,可在变分自编码器 (VAE) 框架内增强聚类性能。本研究揭示了情感状态与深度说话人嵌入有效性之间的直接联系。如我们的实验所示,DTG-VAE 提取出更稳健的说话人嵌入,显著提升说话人聚类性能。
引用
@article{arxiv.2509.23358,
title = {Emotional Styles Hide in Deep Speaker Embeddings: Disentangle Deep Speaker Embeddings for Speaker Clustering},
author = {Chaohao Lin and Xu Zheng and Kaida Wu and Peihao Xiang and Ou Bai},
journal= {arXiv preprint arXiv:2509.23358},
year = {2025}
}
备注
6 pages, 4 figures