中文

AquaVLM:借助移动视觉语言模型提升水下情境意识

人机交互 2025-10-28 v1 人工智能

摘要

潜水等水下活动每年吸引数以百万计的民众探索海洋环境,既用于休闲,也用于科学研究。保持情境意识和有效的沟通对于潜水员的安全至关重要。传统的水下通信系统往往笨重且昂贵,限制了其为所有水平的潜水员提供可及性。虽然近期系统利用轻量级智能手机并支持文本消息,但这些消息是预定义的,从而限制了特定情境的沟通。本文提出了 AquaVLM,一个即插即用的水下通信系统,能够自动生成情境感知的消息并通过通用智能手机进行传输。我们的系统特点是针对自动生成的水下对话数据集微调的移动视觉语言模型 (VLM),并采用分层消息生成管道。我们协同设计 VLM 与传输功能,引入容错微调以提高系统对传输错误的鲁健性。我们开发了一个 VR 模拟器,使用户能够在逼真的水下环境中体验 AquaVLM,并在 iOS 平台上创建了一个完全可用的原型用于实际实验。主观评估和客观评估均验证了 AquaVLM 的有效性,并突显了其在个人水下通信以及更广泛的移动 VLM 应用中的潜力。

关键词

引用

@article{arxiv.2510.21722,
  title  = {AquaVLM: Improving Underwater Situation Awareness with Mobile Vision Language Models},
  author = {Beitong Tian and Lingzhi Zhao and Bo Chen and Haozhen Zheng and Jingcheng Yang and Mingyuan Wu and Deepak Vasisht and Klara Nahrstedt},
  journal= {arXiv preprint arXiv:2510.21722},
  year   = {2025}
}

备注

12 pages, 10 figures, under review