说话人嵌入作为个体性代理的语音压力检测
音频与语音处理
2023-06-12 v1 机器学习
摘要
由于说话人的心理状态会调制语音,由认知或体力负荷引入的压力可在语音中被检测出来。现有语音压力检测基准表明,从 Hybrid BYOL-S 自监督模型提取的音频嵌入表现良好。然而,该基准仅在各数据集上分别评估性能,并未跨不同压力类型与不同语言评估性能。此外,先前研究发现压力易感性存在强烈的个体差异。本文介绍语音压力检测的设计与开发,其训练数据来自 9 个语言群体、五类不同压力的上百名说话人。我们通过将说话人嵌入加入 hybrid BYOL-S 特征来解决语音压力分析中的个体变异性。所提方法在仅 3–5 秒输入音频长度下显著提升了语音压力检测性能。
引用
@article{arxiv.2306.05915,
title = {Speaker Embeddings as Individuality Proxy for Voice Stress Detection},
author = {Zihan Wu and Neil Scheidwasser-Clow and Karl El Hajal and Milos Cernak},
journal= {arXiv preprint arXiv:2306.05915},
year = {2023}
}
备注
5 pages, 2 figures. Accepted at Interspeech 2023