中文

利用级联二分类与多模态融合通过自发语音进行痴呆检测

音频与语音处理 2025-05-28 v2

摘要

本文介绍了我们向 PROCESS Challenge 2025 提交的方案,侧重于通过自发语音分析进行早期痴呆检测。针对三分类任务(健康对照、轻度认知障碍和痴呆),我们提出了一个级联二分类框架,该框架对预训练语言模型进行微调,并结合停顿编码以更好地捕捉不流利现象。该设计通过重构决策过程,简化了多分类并解决了类别不平衡问题。针对简易精神状态检查量表得分回归任务,我们开发了一个增强的多模态融合系统,结合了多种声学和语言学特征。在各个特征集上分别训练回归模型,并通过得分平均应用集成学习。在测试集上的实验结果在两项任务中均优于组织者提供的基线,证明了我们方法的鲁棒性和有效性。

关键词

引用

@article{arxiv.2505.19446,
  title  = {Leveraging Cascaded Binary Classification and Multimodal Fusion for Dementia Detection through Spontaneous Speech},
  author = {Yin-Long Liu and Yuanchao Li and Rui Feng and Liu He and Jia-Xin Chen and Yi-Ming Wang and Yu-Ang Chen and Yan-Han Peng and Jia-Hong Yuan and Zhen-Hua Ling},
  journal= {arXiv preprint arXiv:2505.19446},
  year   = {2025}
}

备注

Accepted by Interspeech 2025