迈向通用异常检测与理解:大规模视觉-语言模型(GPT-4V)领跑
计算机视觉与模式识别
2023-11-17 v3 人工智能
摘要
异常检测是跨不同领域与数据类型的关键任务。然而,现有异常检测模型通常针对特定领域与模态设计。本研究探索使用强大的视觉-语言模型GPT-4V(ision)以通用方式解决异常检测任务。我们考察GPT-4V在多模态、多领域异常检测任务中的应用,包括图像、视频、点云和时间序列数据,涵盖工业、医疗、逻辑、视频、3D异常检测与定位任务等多个应用领域。为提升GPT-4V性能,我们引入不同种类的附加线索,如类别信息、人类专业知识和参考图像作为提示。基于我们的实验,GPT-4V在零样本/单样本异常检测中证明对检测和解释全局与细粒度语义模式高度有效。这使得正常与异常实例的准确区分成为可能。尽管我们在本研究中进行了广泛评估,未来评估仍有空间以从不同方面进一步挖掘GPT-4V的通用异常检测能力。这些包括探索定量指标、扩展评估基准、纳入多轮交互以及引入人类反馈回路。尽管如此,GPT-4V在通用异常检测与理解中展现出有前景的性能,从而开辟了异常检测的新途径。
引用
@article{arxiv.2311.02782,
title = {Towards Generic Anomaly Detection and Understanding: Large-scale Visual-linguistic Model (GPT-4V) Takes the Lead},
author = {Yunkang Cao and Xiaohao Xu and Chen Sun and Xiaonan Huang and Weiming Shen},
journal= {arXiv preprint arXiv:2311.02782},
year = {2023}
}
备注
Work in progress. Evaluated GPT-4V on 4 modalities, 9 tasks, and 15 datasets. The first three authors contribute equally