面向层次化流式视频理解的开放式任务:基于视觉语言模型
计算机视觉与模式识别
2025-09-16 v1
摘要
我们提出层次化流式视频理解(Hierarchical Streaming Video Understanding)任务,融合了在线时间动作局化与自由形式描述生成。鉴于缺乏带有层次化和细粒度时间标注的数据集,我们展示了大语言模型(LLM)能够有效地将原子动作聚合为更高层次的事件,从而丰富现有数据集。随后,我们提出了OpenHOUSE(Open-ended Hierarchical Online Understanding System for Events),即开放式层次化在线事件理解系统,其扩展了流式动作感知的范围,超越了动作分类。OpenHOUSE具备专门的流式模块,能够准确检测紧密相邻动作之间的边界,性能几乎翻倍。我们设想,流式动作感知的未来将融合强大的生成模型,而OpenHOUSE是这一方向的关键一步。
引用
@article{arxiv.2509.12145,
title = {Open-ended Hierarchical Streaming Video Understanding with Vision Language Models},
author = {Hyolim Kang and Yunsu Park and Youngbeom Yoo and Yeeun Choi and Seon Joo Kim},
journal= {arXiv preprint arXiv:2509.12145},
year = {2025}
}
备注
17 pages