HPP-Voice:针对多表型分类的语音嵌入的大规模评估
摘要
人类语音包含反映说话人生理和神经状态的副语言线索,potentially 实现对各种医学表型的非侵入式检测。我们介绍了 Human Phenotype Project Voice 语料库( HPP-Voice),该语料库包含 7,188 段录音,说话人为以色列语成年人进行 30 秒计数,每个说话人与最多 15 个可能与语音相关的表型相联系,涵盖呼吸、睡眠、精神、代谢、免疫和神经等疾病。我们系统比较了 14 种现代语音嵌入模型,结果表明,这些 30 秒计数任务中获得的语音嵌入优于 MFCC 和人口统计信息,在下游健康状况分类任务中表现更好。我们发现,来自说话人识别模型学习到的嵌入可预测男性中中度至重度睡眠呼吸暂停,AUC 为 0.64 ± 0.03,而 MFCC 和人口统计特征的 AUC 分别为 0.56 ± 0.02 和 0.57 ± 0.02。此外,我们的结果显示不同医学领域中模型效果存在性别差异。对于男性,说话人识别和说话人分割模型在呼吸系统疾病(例如哮喘:0.61 ± 0.03 vs. 0.56 ± 0.02)和睡眠相关疾病(失眠:0.65 ± 0.04 vs. 0.59 ± 0.05)方面 consistently 优于语音基础模型。对于女性,说话人分割模型在吸烟状态预测中表现最佳(0.61 ± 0.02 vs 0.55 ± 0.02),以色列语特定模型在焦虑分类中表现最佳(0.59 ± 0.02 vs. 0.58 ± 0.02),优于语音基础模型。我们的发现提供了证据,表明简单的计数任务可支持大规模、多表型语音筛查,并揭示了哪些嵌入家族在特定疾病上的泛化效果最佳,为未来的声学生物标志物研究和临床应用提供了指导。
引用
@article{arxiv.2505.16490,
title = {HPP-Voice: A Large-Scale Evaluation of Speech Embeddings for Multi-Phenotypic Classification},
author = {David Krongauz and Hido Pinto and Sarah Kohn and Yanir Marmor and Eran Segal},
journal= {arXiv preprint arXiv:2505.16490},
year = {2025}
}
备注
supplementary figures added; typos corrected