Vox-Profile:面向刻画多样化说话人与语音特征的语音基础模型基准
声音
2025-05-21 v1 音频与语音处理
摘要
我们提出 Vox-Profile,一个综合性基准,用于利用语音基础模型来刻画丰富的说话人与语音特征。与现有仅聚焦单一维度说话人特征的工作不同,Vox-Profile 提供全面、多维度的特征轮廓,反映静态说话人特征(如年龄、性别、方言)以及动态语音属性(如情绪、语流)。该基准植根于语音科学与语言学,由领域专家参与开发,以准确索引说话人与语音特征。我们报告了使用超过 15 个公开语音数据集和几个广泛使用的语音基础模型进行基准实验,这些模型针对各种静态和动态说话人与语音属性进行优化。除了基准实验,我们还展示了 Vox-Profile 支持的几个下游应用。首先,我们展示了 Vox-Profile 如何增强现有语音识别数据集以分析 ASR 性能的可变性。Vox-Profile 也用于评估语音生成系统的性能。最后,我们通过与人类评估的比较显示了自动化特征轮廓的质量,并表明收敛性有效性。Vox-Profile 已公开提供:https://github.com/tiantiaf0627/vox-profile-release。
引用
@article{arxiv.2505.14648,
title = {Vox-Profile: A Speech Foundation Model Benchmark for Characterizing Diverse Speaker and Speech Traits},
author = {Tiantian Feng and Jihwan Lee and Anfeng Xu and Yoonjeong Lee and Thanathai Lertpetchpun and Xuan Shi and Helin Wang and Thomas Thebaud and Laureano Moro-Velazquez and Dani Byrd and Najim Dehak and Shrikanth Narayanan},
journal= {arXiv preprint arXiv:2505.14648},
year = {2025}
}