Vo-Ve:一种用于说话人身份评估的可解释语音向量
声音
2025-06-25 v1 音频与语音处理
摘要
本文提出了 Vo-Ve,这是一种一种新的语音向量嵌入,用于捕获说话人身份。与传统说话人嵌入不同,Vo-Ve 是可解释的,因为它包含了显式语音属性类别的概率。通过广泛的分析,我们展示,Vo-Ve 不仅在与传统技术相竞争的情况下评估说话人相似性,而且还提供了以语音属性为解释语的可解释解释。我们强烈相信,Vo-Ve 由于其高层次的可解释性,可以提高各种语音任务中评估方案的性能。
引用
@article{arxiv.2506.19446,
title = {Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation},
author = {Jaejun Lee and Kyogu Lee},
journal= {arXiv preprint arXiv:2506.19446},
year = {2025}
}
备注
Interspeech 2025