跨语言角色驱动数据合成用于鲁棒多模态认知衰退检测
计算与语言
2026-02-10 v1
摘要
基于语音的数字生物标志物代表了早期识别轻度认知障碍(MCI)的一种可扩展、非侵入性的前沿方法。然而,鲁棒诊断模型的开发仍然受到临床数据严重匮乏和缺乏可解释推理的阻碍。当前的解决方案常常难以实现跨语言泛化,并且无法提供临床信任所必需的透明推理过程。为了解决这些障碍,我们引入了 SynCog,一个新颖的框架,它将可控的零样本多模态数据合成与思维链(CoT)推理微调相结合。具体来说,SynCog 模拟了具有不同认知特征的多样化虚拟受试者,以有效缓解临床数据匮乏问题。这种生成范式能够快速、零样本地扩展跨语言的临床语料库,有效绕过低资源环境中的数据瓶颈,并增强多模态大语言模型(MLLM)的诊断性能。利用这个合成数据集,我们使用 CoT 推理策略微调了一个基础多模态骨干网络,使模型能够明确阐述诊断思维过程,而不是依赖黑盒预测。在 ADReSS 和 ADReSSo 基准上的大量实验表明,用合成表型增强有限的临床数据可产生有竞争力的诊断性能,分别达到 80.67% 和 78.46% 的 Macro-F1 分数,优于当前的基线模型。此外,在一个独立的真实世界普通话队列(CIR-E)上的评估展示了鲁棒的跨语言泛化能力,达到了 48.71% 的 Macro-F1 分数。这些发现为全球医疗保健提供临床可信且语言包容的认知评估工具迈出了关键一步。
引用
@article{arxiv.2602.07978,
title = {Cross-Linguistic Persona-Driven Data Synthesis for Robust Multimodal Cognitive Decline Detection},
author = {Rui Feng and Zhiyao Luo and Liuyu Wu and Wei Wang and Yuting Song and Yong Liu and Kok Pin Ng and Jianqing Li and Xingyao Wang},
journal= {arXiv preprint arXiv:2602.07978},
year = {2026}
}
备注
18 pages, 7 figures, 6 tables