中文

DARA:领域与关系感知适配器实现视觉定位的参数高效微调

计算机视觉与模式识别 2024-06-11 v2 多媒体

摘要

视觉定位(VG)是一项具有挑战性的任务,旨在根据文本描述在图像中定位物体。近期 VG 模型规模的激增显著提升了性能,但也给微调过程中的计算成本带来了巨大负担。在本文中,我们探索应用参数高效迁移学习(PETL)将预训练的视觉-语言知识高效地迁移到 VG 任务。具体来说,我们提出了 DARA,一种新颖的 PETL 方法,包含领域感知适配器(DA Adapters)和关系感知适配器(RA Adapters)用于 VG。DA 适配器首先将模态内的表示迁移为更细粒度的 VG 领域表示。然后,RA 适配器共享权重以桥接两个模态之间的关系,从而改善空间推理。在广泛使用的基准上的实验结果表明,与完全微调和其他 PETL 方法相比,DARA 在节省大量更新参数的同时达到了最佳精度。值得注意的是,仅使用 2.13% 的可调骨干参数,DARA 在三个基准上的平均精度比基线模型提高了 0.81%。我们的代码可在 https://github.com/liuting20/DARA 获取。

关键词

引用

@article{arxiv.2405.06217,
  title  = {DARA: Domain- and Relation-aware Adapters Make Parameter-efficient Tuning for Visual Grounding},
  author = {Ting Liu and Xuyang Liu and Siteng Huang and Honggang Chen and Quanjun Yin and Long Qin and Donglin Wang and Yue Hu},
  journal= {arXiv preprint arXiv:2405.06217},
  year   = {2024}
}

备注

Accepted by ICME 2024 (Oral)