基于感知嗓音特征的说话人身份可解释表征
声音
2023-10-05 v1 机器学习
音频与语音处理
摘要
与文本和视觉等其他数据模态不同,语音不易于解释。尽管外行人士懂得如何通过感知描述图像或句子,但对语音的非专家描述往往止步于性别或年龄等高层人口统计信息。本文提出一种基于感知嗓音质量(PQs)的说话人身份可解释表征。通过将带性别属性的 PQs 添加到以病理为中心的嗓音共识听觉感知评估(CAPE-V)协议,我们的基于 PQ 的方法提供了一个成人嗓音特征的感知潜空间,该空间是高层人口统计信息与低层声学、物理或习得表征之间的抽象中介。与先前观点相反,我们证明这些 PQs 可被非专家群体听闻,并进一步证明基于 PQ 的表征中所编码的信息可由多种语音表征预测。
引用
@article{arxiv.2310.02497,
title = {Towards an Interpretable Representation of Speaker Identity via Perceptual Voice Qualities},
author = {Robin Netzorg and Bohan Yu and Andrea Guzman and Peter Wu and Luna McNulty and Gopala Anumanchipalli},
journal= {arXiv preprint arXiv:2310.02497},
year = {2023}
}