HERMES:基于片段与语义的时间连贯长视频理解
计算机视觉与模式识别
2025-06-27 v4 人工智能
计算与语言
摘要
长视频理解带来了超越传统短视频分析方法的独特挑战,特别是在捕获长程依赖、高效处理冗余信息以及提取高级语义概念方面。为了应对这些挑战,我们提出了一种更准确反映人类认知的新颖方法。本文介绍了 HERMES:基于片段与语义的时间连贯长视频理解,其包含两个多功能模块,可以增强现有的视频语言模型或作为独立系统运行。我们的片段压缩器(ECO)有效地将表示从微观聚合到半宏观层面,在减少计算开销的同时保留了时间依赖性。我们的语义检索器(SeTR)通过关注更广泛的上下文,用语义信息丰富这些表示,在保留相关宏观信息的同时,显著降低了特征维度。我们证明了这些模块可以无缝集成到现有的 SOTA 模型中,在将推理延迟降低高达 43%、内存使用降低 46% 的同时,持续提升其性能。作为独立系统,HERMES 在零样本和全监督设置下的多个长视频理解基准上均取得了 SOTA 性能。
引用
@article{arxiv.2408.17443,
title = {HERMES: temporal-coHERent long-forM understanding with Episodes and Semantics},
author = {Gueter Josmy Faure and Jia-Fong Yeh and Min-Hung Chen and Hung-Ting Su and Shang-Hong Lai and Winston H. Hsu},
journal= {arXiv preprint arXiv:2408.17443},
year = {2025}
}
备注
Accepted for ICCV 2025. Project page: https://joslefaure.github.io/assets/html/hermes.html