中文

面向多对象情感分析的基准数据集

计算机视觉与模式识别 2025-11-17 v2 人工智能

摘要

多模态大语言模型(MLLM)在视觉问答、图像描述和情感识别等高层语义任务中取得了显著进展。然而,尽管已取得进展,仍缺乏用于评估MLLM在多对象情感分析方面性能的标准化基准数据集,这是语义理解中的关键任务。为填补这一空白,我们引入MOSABench,这是一个专为多对象情感分析设计的新型评估数据集。MOSABench包含约1000幅包含多个对象的图像,要求MLLM独立评估每个对象的情感,从而反映真实世界的复杂性。MOSABench的关键创新包括基于距离的目标标注、用于标准化输出的后处理以及改进的评分机制。我们的实验揭示了当前MLLM的 notable局限性:尽管某些模型,如mPLUG-owl和Qwen-VL2,显示出对情感相关特征的有效注意力,但其他模型注意力分散且表现下降,尤其当对象之间的空间距离增加时。这一研究强调了MLLM在复杂的多对象情感分析任务中提升准确性的必要性,并将MOSABench确立为推动MLLM情感分析能力发展的基础工具。

关键词

引用

@article{arxiv.2412.00060,
  title  = {MOSABench: Multi-Object Sentiment Analysis Benchmark for Evaluating Multimodal Large Language Models Understanding of Complex Image},
  author = {Shezheng Song and Chengxiang He and Shan Zhao and Chengyu Wang and Qian Wan and Tianwei Yan and Meng Wang},
  journal= {arXiv preprint arXiv:2412.00060},
  year   = {2025}
}