AffectVerse:用于多模态情感计算的情感世界模型
计算机视觉与模式识别
2026-05-20 v1
摘要
人类通过整合观察到的多模态线索与关于情感状态如何演变的期望来推断情绪。然而,现有的多模态大语言模型 (MLLM) 常将情感识别视为完整音视频文本输入上的静态融合,使情感动态隐含于其中。我们提出了 AffectVerse,基于 Qwen2.5-Omni 的模型,配备情感世界模块 (EWM),用于短视野潜在情感预测的无动作表示级模块。EWM 包含三个模块:1) 跨模态时间想象预测基于过去 token 的未来视频/音频表示进行多步展 rollouts。2) MAMA(模态感知多步注意) 信念聚合将想象 token 压缩为模态感知信念 token。3) 信念注入将这些信念 token 插入 LLM 以进行情感推理。AffectVerse 将未来预测作为过去条件化的自监督信号:它不取代建模观察历史或在推理时要求不可见信号,而是迫使当前信念状态编码可预测后续情感变化的过渡线索。跨越九个基准测试,AffectVerse 在其他模型上提升了至少 2.57%,而受控消融实验显示时间想象、跨模态 rollout 和信念聚合均带来增益。这些结果表明,预测信念状态建模是情感计算的实用替代方案。
关键词
引用
@article{arxiv.2605.19950,
title = {AffectVerse: Emotional World Models for Multimodal Affective Computing},
author = {Bo Zhao and Fanghua Ye and Yixin Ji and Sicheng Zhao and Xiaojiang Peng and Zitong YU},
journal= {arXiv preprint arXiv:2605.19950},
year = {2026}
}