MERLION:语言引导的在线信息性视觉采样与增强海洋探索
机器人学
2025-03-25 v2
摘要
使用自主水下航行器(AUV)进行自主和定向的水下视觉监测与探索,由于在线和离线约束的限制,可能是一项具有挑战性的任务。在线约束包括有限的机载存储容量和到水面的通信带宽,而离线约束则涉及从视频数据中选择所需关键帧所需的时间和精力。定向水下视觉监测的一个示例用例是在 AUV 视觉体验的长序列中寻找最有趣的鱼类视觉帧。在能见度差的浑浊水域中,这种定向信息采样挑战进一步加剧。在本文中,我们提出了 MERLION,这是一个为浑浊水下海洋环境监测与探索提供语义对齐和视觉增强摘要的新颖框架。具体而言,我们的框架集成了: 用于将视觉样本与用户需求进行语义对齐的图文模型, 用于浑浊水域视觉数据的图像增强模型,以及 用于总结监测体验的信息采样器。我们通过用户研究在真实世界数据上验证了所提出的 MERLION 框架,并使用我们的评估指标展示了定性和定量结果,表明与 SOTA 方法相比取得了更好的结果。我们已在以下链接开源了 MERLION 的代码 https://github.com/MARVL-Lab/MERLION.git。
引用
@article{arxiv.2503.06953,
title = {MERLION: Marine ExploRation with Language guIded Online iNformative Visual Sampling and Enhancement},
author = {Shrutika Vishal Thengane and Marcel Bartholomeus Prasetyo and Yu Xiang Tan and Malika Meghjani},
journal= {arXiv preprint arXiv:2503.06953},
year = {2025}
}
备注
In proceedings of IEEE ICRA 2025