中文

语音作为多模态数字表型用于基于 LLM 的多任务心理健康预测

计算与语言 2025-07-24 v3 多媒体

摘要

语音是一种非侵入性的数字表型,能够为心理健康状况提供有价值的见解,但它通常被视为单一模态。相比之下,我们提出将患者语音数据作为用于抑郁症检测的三模态多媒体数据源。本研究探索了基于大语言模型(LLM)的架构在多模态机制下进行基于语音的抑郁症预测的潜力,该机制整合了语音衍生文本、声学标志和声音生物标志物。青少年抑郁症是一个重大挑战,且通常与多种疾病共病,如自杀意念和睡眠障碍。这为我们的研究提供了整合多任务学习(MTL)的额外机会,通过使用多模态表述同时预测抑郁症、自杀意念和睡眠障碍。我们还提出了一种纵向分析策略,对多次临床交互中的时间变化进行建模,从而全面了解病情的进展。我们提出的方法具有三模态、纵向 MTL 的特点,在抑郁症预警数据集上进行了评估。它实现了 70.8% 的平衡准确率,高于所有的单模态、单任务和非纵向方法。

关键词

引用

@article{arxiv.2505.23822,
  title  = {Speech as a Multimodal Digital Phenotype for Multi-Task LLM-based Mental Health Prediction},
  author = {Mai Ali and Christopher Lucasius and Tanmay P. Patel and Madison Aitken and Jacob Vorstman and Peter Szatmari and Marco Battaglia and Deepa Kundur},
  journal= {arXiv preprint arXiv:2505.23822},
  year   = {2025}
}

备注

6 pages, 1 figure, 3 tables. The corresponding author is Mai Ali (maia dot ali at mail dot utoronto dot ca). Christopher Lucasius and Tanmay P. Patel contributed equally