中文

VISAFF:面向对话情感识别的以说话人为中心的视觉情感特征学习

人工智能 2026-05-19 v1

摘要

对话情感识别(Emotion Recognition in Conversation, ERC)对于有效的人机交互至关重要,旨在识别多轮对话中说话人的情绪状态。早期基于文本的方法难以处理讽刺等复杂场景,因为它们本质上忽略了重要的非语言信息。虽然最近的视觉-语言模型(Vision-Language Models, VLMs)通过直接分析视频解决了这一问题,但它们本质上并非为 ERC 定制,通常关注与情感无关的背景区域或被动倾听者,而非主动说话者。此外,微调这些大模型会产生高昂的计算成本。另外,如果没有语言内容和声音韵律的上下文,孤立的视觉信号通常是模糊的或在技术上受损的。为了应对这些挑战,我们提出了 VISAFF,一个面向 ERC 的以说话人为中心的 VISual AFFective(视觉情感)特征学习框架。VISAFF 包含两个阶段:以说话人为中心的情感定位和可靠性引导的情感互补。VISAFF 利用免微调方法解锁冻结 VLMs 的推理能力,有效地引导它们关注主动说话者的情感视觉线索,而无需繁重的训练开销。在第二阶段,我们引入了一种可靠性引导的情感互补机制,动态利用文本和声学模态来补偿视觉不确定性。在两个真实世界数据集上的实验表明,与最先进的方法相比,VISAFF 在免微调设置下实现了极具竞争力的性能,通过消除对大型 VLMs 昂贵微调的需求,显著提高了计算效率。源代码可在 https://anonymous.4open.science/r/speaker-2365/ 获取。

关键词

引用

@article{arxiv.2605.18547,
  title  = {VISAFF: Speaker-Centered Visual Affective Feature Learning for Emotion Recognition in Conversation},
  author = {Linan ZHU and Zihao Zhai and Xiao Han and Yuqian Fu and Xiangfan Chen and Xiangjie Kong and Guojiang Shen},
  journal= {arXiv preprint arXiv:2605.18547},
  year   = {2026}
}