HiVG:面向视觉 grounding 的层次化多模态细粒度调制
计算机视觉与模式识别
2024-09-06 v2
摘要
视觉 grounding 是通过自然语言定位视觉区域的任务,高度依赖跨模态对齐。现有工作利用单模态预训练模型分别传递视觉或语言知识,却忽略了多模态对应的信息。受对比式语言-图像预训练和低秩适配(LoRA)方法的最新进展启发,我们旨在基于多模态预训练解决 grounding 任务。然而,预训练与 grounding 之间存在显著的任务差距。为此,我们提出一种简洁高效的层次化多模态细粒度调制框架,称为 HiVG。具体而言,HiVG 包含多层自适应跨模态桥接器和层次化多模态低秩适配(HiLoRA)范式。跨模态桥接器可解决视觉特征与 grounding 所需特征之间的不一致性,并建立多层视觉特征与文本特征之间的连接。HiLoRA 通过从浅层到深层层次化方式调整跨模态特征,防止感知误差的累积。在五个数据集上的实验结果表明,我们的方法有效性,展示了显著的 grounding 能力以及有希望的能源效率优势。项目页面:https://github.com/linhuixiao/HiVG。
关键词
引用
@article{arxiv.2404.13400,
title = {HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual Grounding},
author = {Linhui Xiao and Xiaoshan Yang and Fang Peng and Yaowei Wang and Changsheng Xu},
journal= {arXiv preprint arXiv:2404.13400},
year = {2024}
}
备注
Accepted by ACM MM 2024. The project page: https://github.com/linhuixiao/HiVG