中文

PV-VTT: 一个面向任务特定异常检测与自然语言解释的隐私中心数据集

计算机视觉与模式识别 2024-12-06 v2

摘要

视频犯罪检测是计算机视觉和人工智能的一项重要应用。然而,现有数据集主要侧重于通过分析整个视频片段来检测严重犯罪,常常忽略了可能预防这些犯罪的前兆活动(即隐私侵犯)。为解决这一局限性,我们提出了 PV-VTT(隐私侵犯视频转文本),一个旨在识别隐私侵犯的独特多模态数据集。PV-VTT 为场景中的视频和文本提供了详细的标注。为确保视频中个人的隐私,我们仅提供视频特征向量,避免发布任何原始视频数据。这种以隐私为中心的方法允许研究人员在保护参与者机密性的同时使用该数据集。认识到隐私侵犯通常是模糊且依赖于上下文的,我们提出了一种基于图神经网络(GNN)的视频描述模型。我们的模型为大型语言模型(LLM)生成基于 GNN 的提示和图像,从而提供经济高效且高质量的视频描述。通过利用单个视频帧以及相关文本,我们的方法减少了所需的输入令牌数量,在保持描述质量的同时优化了 LLM API 的使用。大量实验验证了我们的方法在视频描述任务中的有效性和可解释性,以及我们 PV-VTT 数据集的灵活性。

关键词

引用

@article{arxiv.2410.22623,
  title  = {PV-VTT: A Privacy-Centric Dataset for Mission-Specific Anomaly Detection and Natural Language Interpretation},
  author = {Ryozo Masukawa and Sanggeon Yun and Yoshiki Yamaguchi and Mohsen Imani},
  journal= {arXiv preprint arXiv:2410.22623},
  year   = {2024}
}

备注

Accepted to WACV 2025, Dataset Available Here : https://ryozomasukawa.github.io/PV-VTT.github.io/