中文

Da Yu: 面向水道监视与场景理解的基于USV的图像字幕生成

计算机视觉与模式识别 2025-07-02 v2 机器人学

摘要

自动化水道环境感知对于使无人面板舰船(USVs)理解其周围环境并做出明智的决策至关重要。大多数现有水道感知模型主要关注实例级对象感知范式(如检测、分割)。然而,由于水道环境的复杂性,当前的感知数据集和模型无法实现对水道的全局语义理解,限制了大规模监控和结构化日志生成。随着视觉语言模型(VLM)的发展,我们利用图像字幕引入WaterCaption——第一个专为水道环境设计的字幕数据集。WaterCaption聚焦于细粒度、多区域长文本描述,为视觉地理理解和空间场景认知提供了新的研究方向。具体而言,它包括20.2k图像-文本对数据,包含180万词汇规模。此外,我们提出了Da Yu——一个面向USV的边缘可部署多模态大型语言模型,提出了一种称为Nano Transformer Adaptor(NTA)的新型视觉到语言投影器。NTA有效平衡了计算效率与全局和细粒度局部视觉特征建模的能力,从而显著增强了模型生成长形式文本输出的能力。Da Yu在WaterCaption和其他几个字幕基准测试中实现了在性能和效率之间的最佳平衡,超越了最先进的模型。

关键词

引用

@article{arxiv.2506.19288,
  title  = {Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding},
  author = {Runwei Guan and Ningwei Ouyang and Tianhao Xu and Shaofeng Liang and Wei Dai and Yafeng Sun and Shang Gao and Songning Lai and Shanliang Yao and Xuming Hu and Ryan Wen Liu and Yutao Yue and Hui Xiong},
  journal= {arXiv preprint arXiv:2506.19288},
  year   = {2025}
}

备注

14 pages, 13 figures