中文

Reverse-Speech-Finder: 一种用于生成阿尔茨海默病语音样本并提升诊断性能的神经网络回溯架构

机器学习 2025-05-26 v1 声音 音频与语音处理

摘要

本研究引入了 Reverse-Speech-Finder (RSF),一种用于通过语音分析增强阿尔茨海默病 (AD) 诊断的突破性神经网络回溯架构。利用预训练大语言模型的力量,RSF 识别并利用最有可能预测 AD 的语音标记,解决了真实 AD 语音样本稀缺以及现有模型可解释性有限的挑战。RSF 的独特方法包含三个核心创新:第一,它利用了这样一个观察,即最有可能预测 AD 的语音标记(定义为最可能语音标记 MPMs)必须具有最高概率激活那些最有可能预测 AD 的神经元(定义为最可能神经元 MPNs);第二,它在输入层使用语音 token 表示,允许从 MPNs 回溯以识别 AD 的最可能语音 token (MPTs);第三,它开发了一种创新的回溯方法,从 MPNs 向后追踪到输入层,识别 MPTs 和相应的 MPMs,并巧妙地揭示 AD 检测的新语音标记。实验结果证明了 RSF 相对于 SHAP 和 Integrated Gradients 等传统方法的优越性,准确率提升了 3.5%,F1 分数提升了 3.2%。通过生成封装了新标记的语音数据,RSF 不仅缓解了真实数据稀缺的限制,还显著增强了 AD 诊断模型的鲁棒性和准确性。这些发现强调了 RSF 作为语音 AD 检测变革性工具的潜力,为 AD 相关的语言缺陷提供了新见解,并为更有效的非侵入性早期干预策略铺平了道路。

关键词

引用

@article{arxiv.2505.17477,
  title  = {Reverse-Speech-Finder: A Neural Network Backtracking Architecture for Generating Alzheimer's Disease Speech Samples and Improving Diagnosis Performance},
  author = {Victor OK Li and Yang Han and Jacqueline CK Lam and Lawrence YL Cheung},
  journal= {arXiv preprint arXiv:2505.17477},
  year   = {2025}
}