中文

ClaritySpeech:语音中的痴呆混淆技术

计算与语言 2025-07-15 v1 密码学与安全 机器学习 声音 音频与语音处理

摘要

痴呆症为一种神经退行性疾病,改变语音模式,造成沟通障碍并引发隐私问题。当前的语音技术,如自动语音转录(ASR),在处理痴呆及非典型语音方面困难,进一步挑战了可访问性。本文提出一种新颖的语音痴呆混淆框架——ClaritySpeech,集成了ASR、文本混淆和零样本文本转语音(TTS)技术,能够在无需微调的情况下纠正痴呆患者受影响的语音,同时保持说话人身份特征。结果显示,在多种对抗性设置和模态(音频、文本、融合)下,ADReSS和ADReSSo的平均F1分数分别下降16%和10%,保持50%的说话人相似度。我们还发现该系统改善了WER(ADReSS从0.73降至0.08,ADReSSo为0.15)和语音质量(从1.65提升至约2.15),增强了隐私保护和可访问性。

关键词

引用

@article{arxiv.2507.09282,
  title  = {ClaritySpeech: Dementia Obfuscation in Speech},
  author = {Dominika Woszczyk and Ranya Aloufi and Soteris Demetriou},
  journal= {arXiv preprint arXiv:2507.09282},
  year   = {2025}
}

备注

Accepted at Interspeech 2025