中文

面向图像-文本匹配的 LLM 增强型动作感知多模态提示调优

计算机视觉与模式识别 2025-07-15 v2

摘要

受大规模对比式视觉语言预训练模型如 CLIP 的驱动,图像-文本匹配任务的近期进展在表征学习方面取得了显著成果。由于仅实现图像级视觉-语言对齐,CLIP 在理解物体属性及物体之间空间关系等细粒度细节方面存在不足。近期研究尝试通过引入提示学习来促使 CLIP 获得结构化视觉表征,以实现物体级对齐。虽然取得了令人鼓舞的结果,但仍缺乏感知动作的能力,而动作是描述物体状态或关系的关键因素。因此,本文提出通过引入 LLM 增强的动作感知多模态提示调优方法,赋予 CLIP 以细粒度动作级理解能力,融合由大语言模型 (LLM) 生成的与动作相关的外部知识。具体而言,我们设计了动作三元组提示和动作状态提示,以利用 LLM 中隐含的构成性语义知识和状态相关因果知识。随后,我们提出一种自适应交互模块,依据动作感知提示知识聚合注意力视觉特征,以建立判别性且动作感知的视觉表征,从而进一步提升性能。广泛的实验结果表明,该方法在两个基准数据集上取得了良好效果。

关键词

引用

@article{arxiv.2506.23502,
  title  = {LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching},
  author = {Mengxiao Tian and Xinxiao Wu and Shuo Yang},
  journal= {arXiv preprint arXiv:2506.23502},
  year   = {2025}
}

备注

accepted by ICCV 2025