中文

面向隐私保护的失语人及老年人语音识别的正则化联邦学习

音频与语音处理 2025-06-16 v1 人工智能 计算与语言 声音

摘要

准确识别失语人及老年人语音至今仍具有挑战性。尽管隐私 concerns 推动了从集中方法向联邦学习(FL)的转变以确保数据保密,但这进一步加剧了数据稀缺、数据分布不平衡和说话人异构性等挑战。为此,本文系统性地探讨了针对隐私保护下失语人及老年人语音识别的正则化FL技术,旨在解决FL过程中的不同层面问题:1)基于参数的正则化、2)基于嵌入的正则化、3)基于新损失的正则化。实验在基准UASpeech失语人及DementiaBank Pitt老年人语音语料库上表明,正则化FL系统始终优于基线FedAvg系统,实现最高达0.55%绝对(2.13%相对)的统计显著WER降低。进一步增加通信频率至每批次一次交互,可接近集中训练性能。

关键词

引用

@article{arxiv.2506.11069,
  title  = {Regularized Federated Learning for Privacy-Preserving Dysarthric and Elderly Speech Recognition},
  author = {Tao Zhong and Mengzhe Geng and Shujie Hu and Guinan Li and Xunying Liu},
  journal= {arXiv preprint arXiv:2506.11069},
  year   = {2025}
}