中文

AVERE:通过偏好优化提升音视频情感推理

机器学习 2026-02-10 v1 计算机视觉与模式识别 人机交互

摘要

情感理解是构建社会智能代理的关键。尽管最近的多模态大语言模型在此任务上表现出色,但仍存在两个关键挑战:情感与无关音视频线索之间的虚假关联,以及语言模型背板驱动的文本先验导致的音视频线索幻觉。为量化和理解这些问题,我们引入了 EmoReAlM 基准测试,用于评估 MLLMs 在线索-情感关联、幻觉和模态一致性方面的表现。随后,我们提出了 AVEm-DPO,这是一种偏好优化技术,通过将模型响应与音视频输入和情感导向查询保持一致来实现。具体而言,我们对表现出虚假关联或幻觉的响应以及由文本提示引导的音视频输入对进行偏好排序。我们还包括一个正则化项,以惩罚对文本先验的依赖,从而缓解模态特定线索的幻觉。在 DFEW、RAVDESS 和 EMER 上的实验结果表明,我们的方法在零样本设置下显著提升了参考基线模型的性能,实现了6-19%的相对性能提升。通过提供严谨的基准测试和稳健的优化框架,本工作为情感理解和社交 AI 的 MLLMs 做出原则性评估和改进提供了可能。代码、模型和基准将在 https://avere-iclr.github.io 发布。

关键词

引用

@article{arxiv.2602.07054,
  title  = {AVERE: Improving Audiovisual Emotion Reasoning with Preference Optimization},
  author = {Ashutosh Chaubey and Jiacheng Pang and Maksim Siniukov and Mohammad Soleymani},
  journal= {arXiv preprint arXiv:2602.07054},
  year   = {2026}
}

备注

Accepted as a conference paper at ICLR 2026. Project page: https://avere-iclr.github.io