中文

声音、面孔与情感:多模态情感-认知描述用于精神健康理解

多媒体 2026-03-03 v1

摘要

情感和认知因素是理解精神健康障碍的关键因素。然而,现有方法常将多模态数据视为分类任务,限制了可解释性,尤其是对于情感和认知。虽然大型语言模型(LLM)为精神健康分析提供了机会,但它们主要依赖文本语义,忽略了多模态输入中细粒度的情感和认知线索。虽然一些研究通过迁移学习整合情感特征,但其与精神健康状况的关联仍不明确。为此,我们提出ECMC(Emotion-Cognition Captioning,情感-认知描述),这是一项旨在从多模态数据生成情感和认知状态自然语言描述,并产生情感-认知轮廓以提高精神健康评估准确性和可解释性的新任务。我们采用编码器-解码器架构,其中模态特定编码器提取特征,通过基于Q-former的双流桥接网络(BridgeNet)进行融合。对比学习增强了情感和认知特征的提取。随后,LLaMA解码器将这些特征与标注描述对齐,以生成详细描述。广泛的客观和主观评估表明:1)ECMC在生成情感-认知描述方面优于现有的多模态LLM和精神健康模型;2)生成的情感-认知轮廓显著提高了精神健康分析中辅助诊断和可解释性。

关键词

引用

@article{arxiv.2603.01816,
  title  = {Voices, Faces, and Feelings: Multi-modal Emotion-Cognition Captioning for Mental Health Understanding},
  author = {Zhiyuan Zhou and Yanrong Guo and Shijie Hao},
  journal= {arXiv preprint arXiv:2603.01816},
  year   = {2026}
}

备注

Accepted at AAAI 2026