通过递归利用黑盒多模态大语言模型进行离散提示微调以实现个性化视觉情感识别
计算与语言
2025-09-08 v1 机器学习
摘要
视觉情感识别(VER)是一个重要的研究课题,具有观点挖掘和广告设计等广泛应用。将这种能力扩展到个体层面的情感识别,进一步拓宽了其潜在应用。近期,多模态大语言模型(MLLMs)引起了越来越多的关注,并展现出与传统 VER 方法相当的性能。然而,MLLMs 在包含普遍观点的大型多样化数据集上进行训练,这导致它们倾向于多数派观点和熟悉的模式。这种倾向限制了它们在个性化 VER 中的表现,而这对于实际和现实应用至关重要,并表明了关键的改进方向。为了解决这一局限性,所提出的方法采用受人类提示工程过程启发的离散提示微调,使 VER 任务适应每个个体。我们的方法从生成的提示中选择最佳的自然语言表示,并用它来更新提示,以实现准确的个性化 VER。
引用
@article{arxiv.2509.04480,
title = {Discrete Prompt Tuning via Recursive Utilization of Black-box Multimodal Large Language Model for Personalized Visual Emotion Recognition},
author = {Ryo Takahashi and Naoki Saito and Keisuke Maeda and Takahiro Ogawa and Miki Haseyama},
journal= {arXiv preprint arXiv:2509.04480},
year = {2025}
}
备注
11 pages, 4 figures