解锁 MLLM 情感感知能力的零样本学习中演示配置实证研究
计算与语言
2025-05-23 v1 计算机视觉与模式识别
摘要
多模态大型语言模型(MLLM)的进步使我们能够在零样本范式下解决各种多模态任务。这种范式规避了模型微调的成本,正成为实际应用中占主导地位的趋势。然而,多模态情感分析(MSA)这一关键挑战尚未适应这种便利性。零样本范式在 MSA 上表现不佳,这引发了 MLLM 是否具备与监督模型相当的情感感知能力的疑问。通过将零样本范式扩展至情境学习(ICL),并深入研究演示的配置方式,我们验证了 MLLM 确实具备此类能力。具体而言, comprehensively 研究并优化了覆盖演示检索、呈现与分布的三个关键因素。还发现并有效抵消了 MLLM 中固有的情感预测偏差。通过相互补充,这三方面的策略组合使其在六个 MSA 数据集上相对于零样本范式实现了 15.9% 的平均准确率提升,相对于随机 ICL 基线实现了 11.2% 的提升。
引用
@article{arxiv.2505.16193,
title = {An Empirical Study on Configuring In-Context Learning Demonstrations for Unleashing MLLMs' Sentimental Perception Capability},
author = {Daiqing Wu and Dongbao Yang and Sicheng Zhao and Can Ma and Yu Zhou},
journal= {arXiv preprint arXiv:2505.16193},
year = {2025}
}