中文

FoodMonitor:用于可解释合规性分析的多模态大语言模型基准测试

计算机视觉与模式识别 2026-05-26 v1 人工智能

摘要

随着人工智能驱动的合规性监控在公共治理和工业安全中变得日益重要,提供可验证证据和可追溯问责信号的能力至关重要。然而,现有的视频异常检测数据集侧重于事件级的二值分类,缺乏现实世界合规性场景所需的规则驱动、可解释的分析。我们引入了 FoodMonitor,这是一个用于商业厨房监控中可解释合规性分析的基准。FoodMonitor 包含 477 个视频片段,带有 3,307 个违规标注,采用双通道设计,涵盖人员级和环境级违规。每个标注都指定了违反了哪条规则、发生了何种不合规行为以及由谁实施,并带有帧级边界框。我们建立了一个统一的评估协议,采用两阶段匹配机制,分别评估空间定位和语义理解,以及一个平衡环境和人员检测性能的综合指标 (CscoreC_{\text{score}})。对几个最先进的多模态大语言模型的系统评估表明,表现最佳的模型仅达到 0.360 的 CscoreC_{\text{score}},空间定位和细粒度规则理解成为主要瓶颈。我们的分析识别出两种不同的失败模式:定位主导型错误和语义主导型错误,为未来的模型开发提供了诊断性见解。

关键词

引用

@article{arxiv.2605.24503,
  title  = {FoodMonitor: Benchmarking MLLMs for Explainable Compliance Analysis},
  author = {Ruihao Xu and Xingming Shui and Jingxuan Niu and Yiqin Wang and Jilin Yu and Haoji Zhang and Yansong Tang},
  journal= {arXiv preprint arXiv:2605.24503},
  year   = {2026}
}