中文

基于认知的双流语义增强用于视觉基动态情绪建模

计算机视觉与模式识别 2026-04-15 v1 人工智能

摘要

人类大脑并非通过孤立处理面部表情来构建情绪感知,而是通过动态、层次化的感官输入与语义和情境知识的集成来实现。然而,现有的基于视觉的动态情绪建模方法往往忽视情绪感知和认知理论。为弥合机器与人类情绪感知之间的鸿沟,我们提出了受认知启发的双流语义增强方法(DuSE)。我们的模型实现了双流认知架构。第一流,层次化时间提示聚类(HTPC), operationalizes 了认知 priming 效应。它模拟了语言线索如何预先 sensitize 神经通路,从而通过将文本语义与面部动态细粒度时间特征对齐来调制对新输入视觉刺激的处理。第二流,潜在语义情绪聚合器(LSEA),计算性地建模了类似于概念行为理论所描述的机制,将感官输入与所学概念知识综合,反映了海马体和默认模式网络在构建连贯情绪体验中的作用。通过显式建模这些神经认知机制,DuSE 提供了一个更具神经可信性和鲁棒性的动态面部表情识别(DFER)框架。大量实验在野生动物基准数据集上验证了我们的认知主义方法,证明了模拟大脑情绪处理策略即可实现最先进的性能并提升模型可解释性。

关键词

引用

@article{arxiv.2604.12777,
  title  = {Cognition-Inspired Dual-Stream Semantic Enhancement for Vision-Based Dynamic Emotion Modeling},
  author = {Huanzhen Wang and Ziheng Zhou and Zeng Tao and Aoxing Li and Yingkai Zhao and Yuxuan Lin and Yan Wang and Wenqiang Zhang},
  journal= {arXiv preprint arXiv:2604.12777},
  year   = {2026}
}

备注

Accepted by IEEE ICRA 2026