基于基础模型与形式化验证的规范驱动视频搜索
计算机视觉与模式识别
2023-09-20 v1 形式语言与自动机理论
摘要
视频数据的日益丰富使用户能够搜索感兴趣的事件,例如紧急事件。同时,这也引发了新的担忧,例如对隐私保护的需求。现有的视频搜索方法要么需要人工检查,要么需要具有大量训练的深度学习模型。我们开发了一种方法,利用视觉与语言模型以及形式化方法的最新进展,自动且高效地搜索视频片段中感兴趣的事件。该方法包含一个将基于文本的事件描述映射为有限迹上的线性时序逻辑(LTL)的算法,以及一个构建编码视频信息的自动机的算法。随后,该方法针对 LTL 规范对表示视频的自动机进行形式化验证,若自动机满足规范,则将相关视频片段加入搜索结果。我们提供了定性与定量分析以展示所提方法的视频搜索能力。在隐私敏感视频和一种最先进的自动驾驶数据集上,其搜索精度超过 90%。
引用
@article{arxiv.2309.10171,
title = {Specification-Driven Video Search via Foundation Models and Formal Verification},
author = {Yunhao Yang and Jean-Raphaël Gaglione and Sandeep Chinchali and Ufuk Topcu},
journal= {arXiv preprint arXiv:2309.10171},
year = {2023}
}
备注
12 pages, 18 figures