MoTAS:面向增强多模态阿尔茨海默早期筛查的 TTS 增强语音的 MoE 指导特征选择
声音
2025-08-29 v1 多媒体
摘要
通过语音进行阿尔茨海默病 (AD) 的早期筛查 presents 一个有前景的非侵入性方法。然而,受限数据和缺乏细粒度、自适应特征选择等挑战常常阻碍性能。为此,我们提出 MoTAS,一个旨在提高 AD 筛查效率的 robust 框架。MoTAS 利用文本转语音 (TTS) 增强来增加数据量,并采用 Mixture of Experts (MoE) 机制提高多模态特征选择,从而在提升模型泛化性方面发挥关键作用。该过程以自动语音识别 (ASR) 获得准确转录文本开始。随后使用 TTS 来合成语音以丰富数据集。在提取声学特征和文本嵌入后,MoE 机制动态选择最具信息量的特征,优化特征融合以提高分类性能。在 ADReSSo 数据集上评估的 MoTAS 达到了 85.71% 的领先准确率,优于现有基线方法。消融研究进一步验证了 TTS 增强和 MoE 在提升分类性能中的各自贡献。这些发现凸显了 MoTAS 在实际 AD 筛查场景中的实际价值,尤其是在数据有限的设置中。
引用
@article{arxiv.2508.20513,
title = {MoTAS: MoE-Guided Feature Selection from TTS-Augmented Speech for Enhanced Multimodal Alzheimer's Early Screening},
author = {Yongqi Shao and Binxin Mei and Cong Tan and Hong Huo and Tao Fang},
journal= {arXiv preprint arXiv:2508.20513},
year = {2025}
}