站于运营设计域内:基于视觉语言模型的零样态感知
计算机视觉与模式识别
2026-05-12 v2 人工智能
机器人学
摘要
过去几年,自动系统研究已发展成熟,越来越能够将研究成果转化为贴合具体利益相关方需求的、明确定义域内的实际应用。然而,要实现自动系统的大规模实际采用,遵守安全法规至关重要。许多法规受运营设计域(ODD)影响,定义自动代理能 functioning 的特定条件。这一点尤其适用于自动驾驶系统(ADS),因为可靠的ODD感知是实现安全实施和审计的关键。视觉语言模型(VLM)集成了视觉识别与语言推理,无需任务特定训练数据,因而适用于灵活的ODD感知。为评估VLMs是否可作为能够适应演变定义的零样态ODD传感器,我们贡献了:(i) 在自定义数据集和 Mapillary Vistas 上的四种VLMs进行零样态ODL分类与检测的实证研究,包括失效分析;(ii) 零样态优化策略的消融实验,提供成本-性能概览;(iii) 一套可复用的提示模板,附有适应指导。我们的发现表明,基于定义锚定的链式思维提示与人格分解策略效果最佳,而其他方法可能导致召回率下降。总体而言,我们的工作为安全关键应用中的基于ODL的感知铺平了道路。
引用
@article{arxiv.2605.07649,
title = {Operating Within the Operational Design Domain: Zero-Shot Perception with Vision-Language Models},
author = {Berkehan Ünal and Hauke Dierend and Dren Fazlija and Christopher Plachetka},
journal= {arXiv preprint arXiv:2605.07649},
year = {2026}
}
备注
8 pages, 4 figures