基于文本与音频智能融合的多模态提升抑郁检测
计算与语言
2025-02-03 v2 声音
音频与语音处理
摘要
本研究提出一种创新的多模态融合模型,基于教师-学生体系结构来提高抑郁分类的准确度。我们设计的模型解决了传统方法在特征融合和模态权重分配方面的局限性,通过引入多头注意力机制和加权多模态迁移学习。利用DAIC-WOZ数据集,我们的学生融合模型在文本和听觉教师模型的指导下实现了显著的分类准确率提升。消融实验表明,所提出的模型在测试集上达到了99.1%的F1分数,显著优于单模态和传统方法。我们的方法有效地捕捉了文本和音频特征之间的互补性,同时动态调整教师模型的贡献,以增强泛化能力。实验结果突显了所提出框架在处理复杂多模态数据方面的稳健性和适应性。这项研究为多模态大模型学习中的抑郁分析提供了新颖的技术框架,为解决现有方法在模态融合和特征提取方面的局限性提供了新的见解。
引用
@article{arxiv.2501.16813,
title = {Multimodal Magic Elevating Depression Detection with a Fusion of Text and Audio Intelligence},
author = {Lindy Gan and Yifan Huang and Xiaoyang Gao and Jiaming Tan and Fujun Zhao and Tao Yang},
journal= {arXiv preprint arXiv:2501.16813},
year = {2025}
}
备注
21 pages,7 figures.1 table