从语音中分离内容与说话人身份以评估认知障碍
音频与语音处理
2022-03-22 v1
摘要
深度说话人嵌入除其原始的说话人验证用途外,已被证明可有效评估认知障碍。然而,研究发现说话人嵌入编码了说话人身份以及一系列信息,包括说话人人口统计学特征(如性别与年龄)以及一定程度的语音内容,而这些已知是认知障碍评估中的混杂因素。本文中,我们假设利用语音转换框架从说话人身份中分离出的内容信息更有助于评估认知障碍,并在 DementiaBank Pitt 语料库上训练简单分类器进行比较分析。我们的结果表明,尽管内容嵌入在所定义问题上优于说话人嵌入,但进一步实验显示,由于其提取内容所用架构的固有设计,内容嵌入的有效性依赖于说话人嵌入中所编码的信息。
引用
@article{arxiv.2203.10827,
title = {Separating Content from Speaker Identity in Speech for the Assessment of Cognitive Impairments},
author = {Dongseok Heo and Cheul Young Park and Jaemin Cheun and Myung Jin Ko},
journal= {arXiv preprint arXiv:2203.10827},
year = {2022}
}
备注
5 pages, submitted to INTERSPEECH 2022