驾驶台上的基础模型:利用视觉-语言模型实现海事自主化的语义危险检测与安全机动
摘要
国际海事组织(IMO)的MASS规则草案要求自主和远程监控的海事船舶检测其偏离运行设计域的情况,进入预定义的后备状态并通知操作员,允许立即进行人工接管,并且未经批准不得改变航行计划。在警报至接管的间隙中满足这些义务需要一个短时域、可被人工接管的后备机动。当正确的行动取决于含义时(例如,潜水员下潜旗表示水中有人,附近有火表示危险),经典的海事自主堆栈会陷入困境。我们论证:(i) 视觉-语言模型(VLM)为此类分布外情况提供了语义感知能力,并且 (ii) 一个具有短时域、可被人工接管后备机动的快-慢异常流水线使得这在交接窗口内具有实用性。我们引入了Semantic Lookout,这是一个仅使用摄像头、候选受限的VLM后备机动选择器,它在持续的人工授权下,从水域有效、世界锚定的轨迹中选择一个谨慎的动作(或保持船位)。在40个港口场景中,我们测量了每次调用的场景理解和延迟、与人类共识的一致性(模型三选一多数投票)、在火灾危险场景上的短时域风险缓解,以及一个水上“告警->后备机动->操作员交接”流程。亚10秒模型保留了较慢的最先进模型的大部分感知能力。后备机动选择器优于仅基于几何的基线,并增加了火灾场景中的安全距离。一次实地运行验证了端到端操作。这些结果支持VLM作为符合IMO MASS规则草案的语义后备机动选择器,在实用的延迟预算内,并激励了未来在领域适配、混合自主方面的工作,将基础模型语义与多传感器鸟瞰感知和短时域重规划相结合。网站:kimachristensen.github.io/bridge_policy
引用
@article{arxiv.2512.24470,
title = {Foundation models on the bridge: Semantic hazard detection and safety maneuvers for maritime autonomy with vision-language models},
author = {Kim Alexander Christensen and Andreas Gudahl Tufte and Alexey Gusev and Rohan Sinha and Milan Ganai and Ole Andreas Alsos and Marco Pavone and Martin Steinert},
journal= {arXiv preprint arXiv:2512.24470},
year = {2026}
}
备注
17 pages without bibliography or appendix. The main paper has 16 figures. Paper webpage can be found at https://kimachristensen.github.io/bridge_policy/