中文

MaPPER:面向指代表达理解的多模态先验引导的参数高效调优

计算机视觉与模式识别 2025-06-23 v4 人工智能 计算与语言

摘要

指代表达理解(REC)旨在通过自然语言对局部视觉区域进行定位,是一种高度依赖多模态对齐的任务。大多数现有方法利用强大的预训练模型通过完全微调来传递视觉/语言知识。然而,对整个主干网络进行完全微调不仅会破坏预训练中嵌入的丰富先验知识,还会产生显著的计算成本。针对参数高效迁移学习(PETL)方法近期涌现的事实,我们意在以有效且高效的方式解决REC任务。将这些PETL方法直接应用于REC任务并不合适,因为它们缺乏针对精确局部视觉感知和视觉-语言对齐的特定领域能力。因此,我们提出一种新框架,即多模态先验引导的参数高效调优,称为MaPPER。具体而言,MaPPER包含由对齐先验引导的动态先验适配器,以及用于提取精确局部语义以实现更好视觉感知的局部卷积适配器。此外,还提出了先验引导文本模块,以进一步利用先验促进跨模态对齐。在三个广泛使用的基准测试上进行的实验结果表明,MaPPER在准确率方面优于完全微调和其他PETL方法,仅使用1.41%可调主干参数。我们的代码已公开于https://github.com/liuting20/MaPPER。

关键词

引用

@article{arxiv.2409.13609,
  title  = {MaPPER: Multimodal Prior-guided Parameter Efficient Tuning for Referring Expression Comprehension},
  author = {Ting Liu and Zunnan Xu and Yue Hu and Liangtao Shi and Zhiqiang Wang and Quanjun Yin},
  journal= {arXiv preprint arXiv:2409.13609},
  year   = {2025}
}

备注

EMNLP 2024 main