EmoCaliber:通过置信度语言化与校准推进可靠的视觉情感理解
计算机视觉与模式识别
2025-12-22 v1
摘要
视觉情感理解(VEC)旨在从图像中嵌入的情感线索推断情感极性或情感类别。近年来,多模态大语言模型(MLLM)已成为 VEC 中流行的范式,利用其泛化能力统一了在不同情感分类法下定义的 VEC 任务。虽然这一范式取得了显著成功,但它通常将 VEC 表述为一个确定性任务,要求模型为每张图像输出一个确定的情感标签。这种表述不足以考虑情感感知的内在主观性,忽略了可能对不同观看者同样合理的替代解释。为解决这一局限,我们提出为 MLLM 配备语言化其对情感预测置信度的能力。这一额外信号为用户提供了一个关于替代解释的合理性以及 MLLM 自我评估能力的估计,从而在实践中增强可靠性。基于这一洞察,我们引入了一个三阶段训练框架,逐步赋予结构化推理能力、教授置信度语言化以及校准置信度表达,最终得到 EmoCaliber——一个面向 VEC 的置信度感知 MLLM。通过在统一基准 VECBench 上进行公平且全面的评估,EmoCaliber 在情感预测和置信度估计两方面均展现出对现有方法的整体优势。这些结果验证了我们方法的有效性,标志着向更可靠的 VEC 系统迈出了可行的一步。项目页面:https://github.com/wdqqdw/EmoCaliber.
引用
@article{arxiv.2512.15528,
title = {EmoCaliber: Advancing Reliable Visual Emotion Comprehension via Confidence Verbalization and Calibration},
author = {Daiqing Wu and Dongbao Yang and Can Ma and Yu Zhou},
journal= {arXiv preprint arXiv:2512.15528},
year = {2025}
}