中文

融合场景上下文与语义标签以增强群组级情感识别

计算机视觉与模式识别 2025-09-29 v1

摘要

群组级情感识别旨在识别涉及多个个体的场景中的整体情感。现有方法低估了视觉场景上下文信息在建模个体关系中的重要性。此外,它们忽略了情感标签的语义信息对于完整理解情感的关键作用。为了解决这一局限性,我们提出了一个融合视觉场景上下文和标签引导的语义信息的新颖框架,以提升 GER 性能。该框架包含一个视觉上下文编码模块,利用多尺度场景信息对个体关系进行多样化编码。作为补充,情感语义编码模块利用群组级情感标签提示大型语言模型生成细粒度的情感词表。这些词表与情感标签一起,随后通过结构化情感树被提炼为全面的语义表示。最后,提出相似性感知交互来对齐和整合视觉与语义信息,从而生成增强的群组级情感表示并提升 GER 性能。在三个广泛采用的 GER 数据集上的实验表明,与最先进的方法相比,我们提出的方法取得了具有竞争力的性能。

关键词

引用

@article{arxiv.2509.21747,
  title  = {Incorporating Scene Context and Semantic Labels for Enhanced Group-level Emotion Recognition},
  author = {Qing Zhu and Wangdong Guo and Qirong Mao and Xiaohua Huang and Xiuyan Shao and Wenming Zheng},
  journal= {arXiv preprint arXiv:2509.21747},
  year   = {2025}
}

备注

10 pages, 5figures, submitted to IEEE Transactions on Human-Machine Systems