当大语言模型遇见声学地标:一种将语音高效集成到大语言模型中以进行抑郁症检测的方法
音频与语音处理
2024-09-25 v2 人工智能
声音
摘要
抑郁症是全球心理健康的关键关切,促使人们广泛研究基于 AI 的检测方法。在各种 AI 技术中,大语言模型(LLMs)因其在心理健康护理应用中的多功能性而脱颖而出。然而,其主要局限性源于对文本输入的独占依赖,这限制了其整体能力。此外,利用 LLMs 识别和分析抑郁状态的研究仍相对未被充分开发。本文提出了一种创新方法,将声学语音信息集成到 LLMs 框架中,以实现多模态抑郁症检测。我们研究了一种利用声学地标(Acoustic Landmarks)将语音信号集成到 LLMs 中的高效抑郁症检测方法。通过引入特定于口语发音的声学地标,我们的方法为文本转录本增添了关键维度。这种集成还提供了对个体独特语音模式的洞察,揭示了个体潜在的心理状态。在 DAIC-WOZ 数据集上对所提方法的评估显示,与现有音频 - 文本基线相比,取得了 state-of-the-art 的结果。此外,该方法不仅对抑郁症检测具有价值,还代表了增强 LLMs 理解和处理语音信号能力的新视角。
引用
@article{arxiv.2402.13276,
title = {When LLMs Meets Acoustic Landmarks: An Efficient Approach to Integrate Speech into Large Language Models for Depression Detection},
author = {Xiangyu Zhang and Hexin Liu and Kaishuai Xu and Qiquan Zhang and Daijiao Liu and Beena Ahmed and Julien Epps},
journal= {arXiv preprint arXiv:2402.13276},
year = {2024}
}