面向多任务视觉定位的语言自适应权重生成
计算机视觉与模式识别
2023-06-09 v1
摘要
尽管在视觉定位中表现令人印象深刻,主流方法通常以被动方式利用视觉骨干网络,即视觉骨干网络以固定权重提取特征而无需与表达相关的提示。这种被动感知可能导致不匹配(例如冗余和缺失),限制性能的进一步提升。理想情况下,视觉骨干网络应主动提取视觉特征,因为表达已提供所需视觉特征的蓝图。主动感知可将表达作为先验提取相关视觉特征,从而有效缓解不匹配。受此启发,我们提出一种基于语言自适应权重的主动感知视觉定位框架,称为VG-LAW。视觉骨干网络通过为不同表达生成的动态权重充当特定于表达的特征提取器。受益于从语言感知视觉骨干网络提取的特定且相关的视觉特征,VG-LAW不需要额外的跨模态交互模块。配合简洁的多任务头,VG-LAW可同时胜任指代表达理解与时序分割。在RefCOCO、RefCOCO+、RefCOCOg和ReferItGame四个代表性数据集上的大量实验验证了所提框架的有效性并展示了最先进的性能。
引用
@article{arxiv.2306.04652,
title = {Language Adaptive Weight Generation for Multi-task Visual Grounding},
author = {Wei Su and Peihan Miao and Huanzhang Dou and Gaoang Wang and Liang Qiao and Zheyang Li and Xi Li},
journal= {arXiv preprint arXiv:2306.04652},
year = {2023}
}
备注
Accepted by CVPR2023