利用级联二分类与多模态融合通过自发语音进行痴呆检测
音频与语音处理
2025-05-28 v2
摘要
本文介绍了我们向 PROCESS Challenge 2025 提交的方案,侧重于通过自发语音分析进行早期痴呆检测。针对三分类任务(健康对照、轻度认知障碍和痴呆),我们提出了一个级联二分类框架,该框架对预训练语言模型进行微调,并结合停顿编码以更好地捕捉不流利现象。该设计通过重构决策过程,简化了多分类并解决了类别不平衡问题。针对简易精神状态检查量表得分回归任务,我们开发了一个增强的多模态融合系统,结合了多种声学和语言学特征。在各个特征集上分别训练回归模型,并通过得分平均应用集成学习。在测试集上的实验结果在两项任务中均优于组织者提供的基线,证明了我们方法的鲁棒性和有效性。
引用
@article{arxiv.2505.19446,
title = {Leveraging Cascaded Binary Classification and Multimodal Fusion for Dementia Detection through Spontaneous Speech},
author = {Yin-Long Liu and Yuanchao Li and Rui Feng and Liu He and Jia-Xin Chen and Yi-Ming Wang and Yu-Ang Chen and Yan-Han Peng and Jia-Hong Yuan and Zhen-Hua Ling},
journal= {arXiv preprint arXiv:2505.19446},
year = {2025}
}
备注
Accepted by Interspeech 2025