VisionGPT:面向安全视觉导航的LLM辅助实时异常检测
计算机视觉与模式识别
2024-03-20 v1 人机交互
摘要
本文探索了大型语言模型(LLMs)在面向安全视觉导航的零样本异常检测中的潜力。借助最先进的实时开放世界目标检测模型Yolo-World和专门的提示,所提出的框架能够识别相机捕获帧中包含任何可能障碍物的异常,然后生成简洁的、以音频传递的描述,强调异常情况,从而在复杂环境中辅助安全视觉导航。此外,我们提出的框架利用LLMs和开放词汇目标检测模型的优势实现了动态场景切换,允许用户在不同场景间平滑过渡,解决了传统视觉导航的局限性。进一步地,本文探索了不同提示组件的性能贡献,为未来视觉无障碍性的改进提供了愿景,并为LLMs在视频异常检测和视觉-语言理解中的应用铺平了道路。
引用
@article{arxiv.2403.12415,
title = {VisionGPT: LLM-Assisted Real-Time Anomaly Detection for Safe Visual Navigation},
author = {Hao Wang and Jiayou Qin and Ashish Bastola and Xiwen Chen and John Suchanek and Zihao Gong and Abolfazl Razi},
journal= {arXiv preprint arXiv:2403.12415},
year = {2024}
}