中文

超越语言:利用非语言线索提升欲望、情感与情绪识别

计算机视觉与模式识别 2026-03-17 v2 计算与语言

摘要

多模态欲望理解是一种紧密关联情感与情绪的任务,旨在从视觉与文本线索中推断人类意图,在情感计算中是一个新兴且尚未充分探索的任务,具有社交媒体分析等应用前景。现有方法主要聚焦于挖掘语言线索,往往忽视了图像中有效利用非语言线索的潜力。为弥合这一差距,我们提出了一种用于欲望、情感与情绪识别的对称双向多模态学习框架(SyDES)。SyDES的核心在于实现文本与图像模态之间的双向精细模态对齐。具体而言,我们引入一种混合尺度图像策略,通过对高分辨率子图像进行掩码图像建模(MIM),将低分辨率图像的全局上下文与细粒度局部特征相结合,有效捕获与意图相关的视觉表征。随后,我们设计了对称的跨模态解码器,包括文本引导的图像解码器和图像引导的文本解码器,使两者能够相互重建和细化,从而促进深度跨模态交互。此外,我们设计了一组专门的损失函数,以在优化过程中调和MIM目标与模态对齐目标之间可能的冲突。大量实验表明,我们的方法在MSED基准上表现卓越,在欲望理解任务中实现了1.1%的F1分数提升。情感与情绪识别的持续提升进一步验证了其泛化能力以及利用非语言线索的必要性。我们的代码已公开:https://github.com/especiallyW/SyDES。

关键词

引用

@article{arxiv.2509.15540,
  title  = {Beyond Words: Enhancing Desire, Emotion, and Sentiment Recognition with Non-Verbal Cues},
  author = {Wei Chen and Tongguan Wang and Feiyue Xue and Junkai Li and Hui Liu and Ying Sha},
  journal= {arXiv preprint arXiv:2509.15540},
  year   = {2026}
}

备注

Accepted by WWW 2026