ClaritySpeech:语音中的痴呆混淆技术
计算与语言
2025-07-15 v1 密码学与安全
机器学习
声音
音频与语音处理
摘要
痴呆症为一种神经退行性疾病,改变语音模式,造成沟通障碍并引发隐私问题。当前的语音技术,如自动语音转录(ASR),在处理痴呆及非典型语音方面困难,进一步挑战了可访问性。本文提出一种新颖的语音痴呆混淆框架——ClaritySpeech,集成了ASR、文本混淆和零样本文本转语音(TTS)技术,能够在无需微调的情况下纠正痴呆患者受影响的语音,同时保持说话人身份特征。结果显示,在多种对抗性设置和模态(音频、文本、融合)下,ADReSS和ADReSSo的平均F1分数分别下降16%和10%,保持50%的说话人相似度。我们还发现该系统改善了WER(ADReSS从0.73降至0.08,ADReSSo为0.15)和语音质量(从1.65提升至约2.15),增强了隐私保护和可访问性。
引用
@article{arxiv.2507.09282,
title = {ClaritySpeech: Dementia Obfuscation in Speech},
author = {Dominika Woszczyk and Ranya Aloufi and Soteris Demetriou},
journal= {arXiv preprint arXiv:2507.09282},
year = {2025}
}
备注
Accepted at Interspeech 2025