基于音频数据的多模态方法用于痴呆检测
机器学习
2025-07-08 v2
摘要
痴呆是一种神经退行性疾病,会导致认知功能逐渐受损,是全球范围内常见的疾病,每年都有大量研究用于预防和治疗。它严重影响患者记忆事件和清晰表达的能力,其中大多数变种没有已知的治愈方法,但早期检测有助于在症状加重之前缓解症状。痴呆的主要症状之一是通过语言表达想法时出现困难。本文尝试开发一个模型,用于预测该疾病的发病,使用来自患者的音频记录。开发了一个基于ASR的模型,从音频文件中生成转录文本,然后应用RoBERTa回归模型为患者生成MMSE评分。该评分可用于预测患者认知功能受损的程度。我们使用PROCESS_V1数据集完成此任务,该数据集通过PROCESS大挑战2025年引入。该模型实现的RMSE分为2.6911,约比所述基线低10%。
引用
@article{arxiv.2501.00465,
title = {Dementia Detection using Multi-modal Methods on Audio Data},
author = {Saugat Kannojia and Anirudh Praveen and Danish Vasdev and Saket Nandedkar and Divyansh Mittal and Sarthak Kalankar and Shaurya Johari and Vipul Arora},
journal= {arXiv preprint arXiv:2501.00465},
year = {2025}
}
备注
4 pages