WaterVG:基于文本引导视觉与毫米波雷达的水道视觉定位
计算机视觉与模式识别
2024-04-08 v3 多媒体
机器人学
摘要
基于人类意图的水道感知对于无人水面艇(USV)在水域环境中的自主导航与作业具有重要意义。受视觉定位(visual grounding)启发,我们提出了 WaterVG,这是首个面向 USV 水道感知、基于人类提示的视觉定位数据集。WaterVG 涵盖描述多目标的提示,并在实例层级提供边界框与掩码标注。值得注意的是,WaterVG 包含 11,568 个样本与 34,987 个被指代目标,其提示融合了视觉与雷达双重特征。文本引导的双传感器模式为被指代目标的视觉与雷达特征赋予了更细粒度的文本提示。此外,我们提出了一种低功耗视觉定位模型 Potamoi,它是一种多任务模型,具备精心设计的分相异构模态融合(PHMF)模式,包含自适应雷达加权(ARW)与多头精简交叉注意力(MHSCA)。具体而言,ARW 提取所需的雷达特征以与视觉融合,实现提示对齐;MHSCA 是一个参数量与 FLOPs 均极少的轻量化融合模块,能够优雅地将两种传感器捕获的场景上下文与语言特征相融合,在视觉定位任务上表现优异。我们在 WaterVG 上进行了全面的实验与评估,结果表明 Potamoi 相较于同类方法取得了当前最优(SOTA)的性能。
引用
@article{arxiv.2403.12686,
title = {WaterVG: Waterway Visual Grounding based on Text-Guided Vision and mmWave Radar},
author = {Runwei Guan and Liye Jia and Fengyufan Yang and Shanliang Yao and Erick Purwanto and Xiaohui Zhu and Eng Gee Lim and Jeremy Smith and Ka Lok Man and Xuming Hu and Yutao Yue},
journal= {arXiv preprint arXiv:2403.12686},
year = {2024}
}
备注
10 pages, 10 figures