中文

UrbanClipAtlas:用于城市视频中事件和场景检索的可视分析框架

人机交互 2026-04-17 v1

摘要

从长时间的城市视频中提取可操作的洞察通常是劳动密集型的:分析人员必须手动筛选原始镜头以定位目标事件或发现更广泛的行为趋势。在这项工作中,我们提出了URBANCLIPATLAS,一个用于探索在街道交叉口录制的长城市视频的可视分析系统。URBANCLIPATLAS结合了检索增强生成、分类感知的实体提取和视频定位,以支持事件检索和解释。该系统将长录音分割成短片段,使用视觉语言模型生成文本描述,并为其建立索引以进行语义检索。知识图谱将来自大语言模型答案的实体和关系映射到特定领域的分类法,并将其与检测到的对象和轨迹对齐,以支持视觉定位和验证。URBANCLIPATLAS通过增强的基于聊天的界面支持场景检索,并通过将文本输出与视频证据紧密对齐来改进场景解释。这种设计加强了文本推理与视觉证据之间的联系,减少了验证模型输出和完善假设所需的工作量。我们通过两个涉及街道交叉口危险场景和穿越动态的案例研究,在StreetAware数据集上展示了URBANCLIPATLAS的实用性。URBANCLIPATLAS帮助分析人员推理跨大型城市视频集合的安全和移动相关模式。

关键词

引用

@article{arxiv.2604.15225,
  title  = {UrbanClipAtlas: A Visual Analytics Framework for Event and Scene Retrieval in Urban Videos},
  author = {Joel Perca and Luis Sante and Juanpablo Heredia and Joao Rulff and Claudio Silva and Jorge Poco},
  journal= {arXiv preprint arXiv:2604.15225},
  year   = {2026}
}

备注

12 pages and 6 figures