临床试验中的零样本多语言说话人验证
机器学习
2024-04-09 v2 声音
音频与语音处理
摘要
由于临床试验中涉及的大量医务人员、患者和数据收集环境,收集高质量数据的挑战异常突出。在临床试验中,患者根据其语音数据进行评估,以检测和监控认知和精神健康障碍。我们提议利用这些语音录音来验证注册患者的身份,并识别并排除试图在同一试验中多次注册的个体。由于临床研究常常在不同国家进行,因此创建能够在多种语言环境中进行说话人验证的系统至关重要。我们通过使用说话受损患者讲话的英语、德语、丹麦语、西班牙语和阿拉伯语语言数据,对预训练的 TitaNet、ECAPA-TDNN 和 SpeakerNet 模型进行评估。我们的结果表明,所测试的模型能够有效地对临床说话人进行泛化,欧洲语言的错误等价率 (EER) 小于 2.7%,阿拉伯语的 EER 为 8.26%。这标志着为认知和精神健康临床试验开发更加通用和高效的说话人验证系统的重要一步,这些系统可跨越广泛的语言和方言使用,大大减少了为多个语言开发说话人验证系统所需的工作量。我们还评估了语音任务和参与者数量如何影响性能,并显示语音任务的类型会影响模型性能。
引用
@article{arxiv.2404.01981,
title = {Zero-Shot Multi-Lingual Speaker Verification in Clinical Trials},
author = {Ali Akram and Marija Stanojevic and Malikeh Ehghaghi and Jekaterina Novikova},
journal= {arXiv preprint arXiv:2404.01981},
year = {2024}
}