SmartHome-Bench: 基于多模态大语言模型的智能家居视频异常检测综合基准
计算机视觉与模式识别
2025-06-17 v1
摘要
视频异常检测(VAD)对于通过识别不同环境中的异常事件来增强安全性和保障至关重要。然而,现有的 VAD 基准主要针对通用场景设计,忽视了智能家居应用的特定特征。为了弥合这一差距,我们引入了 SmartHome-Bench,这是第一个专门为评估智能家居场景中的 VAD 而设计的综合基准,重点关注多模态大语言模型(MLLM)的能力。我们新提出的基准由 1,203 个智能家居摄像头录制的视频组成,按照一种新的异常分类法进行组织,包括七个类别,如野生动物、老年人照护和婴儿监护。每个视频都经过仔细标注了异常标签、详细描述和推理。我们进一步研究了 MLLM 在 VAD 中的适应方法,评估了最先进的闭源和开源模型以及各种提示技术。结果揭示了当前模型准确检测视频异常能力的显著局限性。为了解决这些局限性,我们引入了分类驱动的反思 LLM 链(Taxonomy-Driven Reflective LLM Chain, TRLC),这是一种新的 LLM 链式框架,在检测准确率上实现了显著的 11.62% 提升。基准数据集和代码在 https://github.com/Xinyi-0724/SmartHome-Bench-LLM 上公开发布。
引用
@article{arxiv.2506.12992,
title = {SmartHome-Bench: A Comprehensive Benchmark for Video Anomaly Detection in Smart Homes Using Multi-Modal Large Language Models},
author = {Xinyi Zhao and Congjing Zhang and Pei Guo and Wei Li and Lin Chen and Chaoyue Zhao and Shuai Huang},
journal= {arXiv preprint arXiv:2506.12992},
year = {2025}
}
备注
CVPR 2025 Workshop: VAND 3.0 - Visual Anomaly and Novelty Detection