面向图像-文本匹配的 LLM 增强型动作感知多模态提示调优
计算机视觉与模式识别
2025-07-15 v2
摘要
受大规模对比式视觉语言预训练模型如 CLIP 的驱动,图像-文本匹配任务的近期进展在表征学习方面取得了显著成果。由于仅实现图像级视觉-语言对齐,CLIP 在理解物体属性及物体之间空间关系等细粒度细节方面存在不足。近期研究尝试通过引入提示学习来促使 CLIP 获得结构化视觉表征,以实现物体级对齐。虽然取得了令人鼓舞的结果,但仍缺乏感知动作的能力,而动作是描述物体状态或关系的关键因素。因此,本文提出通过引入 LLM 增强的动作感知多模态提示调优方法,赋予 CLIP 以细粒度动作级理解能力,融合由大语言模型 (LLM) 生成的与动作相关的外部知识。具体而言,我们设计了动作三元组提示和动作状态提示,以利用 LLM 中隐含的构成性语义知识和状态相关因果知识。随后,我们提出一种自适应交互模块,依据动作感知提示知识聚合注意力视觉特征,以建立判别性且动作感知的视觉表征,从而进一步提升性能。广泛的实验结果表明,该方法在两个基准数据集上取得了良好效果。
引用
@article{arxiv.2506.23502,
title = {LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching},
author = {Mengxiao Tian and Xinxiao Wu and Shuo Yang},
journal= {arXiv preprint arXiv:2506.23502},
year = {2025}
}
备注
accepted by ICCV 2025