LAVA:面向流量视频分析的语言驱动可扩展通用系统
计算机视觉与模式识别
2025-08-05 v2 多媒体
摘要
在现代城市环境中,摄像网络生成的运营影像量巨大——每天可达 pet 级,这使得大规模视频分析对于高效处理至关重要。许多现有方法采用 SQL 为查询大规模视频数据库的范式;然而,这限制了查询受到刚性模式与预定义语义类别的约束,显著限制了分析灵活性。本文探索了一种以语言驱动的视频分析范式,旨在通过自然语言实现对高容量视频数据的灵活且高效的查询。特别地,我们构建了 \textsc{Lava} 系统,该系统接受自然语言查询并检索跨多个层次和任意类别的流量目标。\textsc{Lava} 由三个主要组件组成:1) 基于多臂老虎机的视频片段级高效采样方法;2) 针对对象级检索的视频特定的开放世界检测模块;3) 用于temporal object association 的长期对象轨迹提取方案,生成对象感兴趣部件的完整轨迹。为支持全面评估,我们进一步开发了一个新基准,提供多样化、语义丰富的自然语言谓词和细粒度注释。实验在该基准上表明,\textsc{Lava} 将选择查询的 F1 分数提高了 ,降低了聚合查询的 MPAE ,并实现了 的 top- 精度,同时比最准确的基线快了 处理视频。我们的代码和数据集均可用于 https://github.com/yuyanrui/LAVA。
引用
@article{arxiv.2507.19821,
title = {LAVA: Language Driven Scalable and Versatile Traffic Video Analytics},
author = {Yanrui Yu and Tianfei Zhou and Jiaxin Sun and Lianpeng Qiao and Lizhong Ding and Ye Yuan and Guoren Wang},
journal= {arXiv preprint arXiv:2507.19821},
year = {2025}
}
备注
Accepted by ACM MM 2025, code: https://github.com/yuyanrui/LAVA