AdaRD-key:用于长视频理解的自适应相关性-多样性关键帧采样
计算机视觉与模式识别
2025-10-06 v1
摘要
由于其广泛的时序长度和高信息密度,理解长视频仍是视觉-语言模型 (VLM) 的重大挑战。大多数当前的多模态大语言模型 (MLLM) 依赖均匀采样,常常忽略关键时刻,导致对查询的回答不正确。与此同时,许多关键帧选择方法会施加严格的时序间隔:一旦选择一帧,排除窗口会抑制相邻的时间戳以减少冗余。虽然有效地限制了重叠,但这种策略经常会错过重要事件附近的短小、细粒度的线索。其他方法则强调视觉多样性,但忽略查询相关性。我们提出了 AdaRD-Key,一种用于查询驱动的长视频理解的训练-free 关键帧采样模块。AdaRD-Key 最大化统一的相关性-多样性最大体积 (RD-MV) 目标,将查询条件相关性得分与 log-行列式 多样性组件相结合,以获得信息丰富且不冗余的帧。为了处理与视频关联较弱的宽泛查询,AdaRD-Key 采用轻量级的相关性感知门控机制;当相关性分布表明关联较弱时,该方法会无缝地切换为仅依赖多样性的模式,以增强覆盖范围而无需额外监督。我们的管道是训练-free 的、计算高效(在单个 GPU 上可实时运行),且与现有的 VLM 兼容,可即插即用。广泛的在 LongVideoBench 和 Video-MME 上的实验表明,我们的方法在长视频方面实现了最佳性能。代码可在 https://github.com/Xian867/AdaRD-Key 获取。
引用
@article{arxiv.2510.02778,
title = {AdaRD-key: Adaptive Relevance-Diversity Keyframe Sampling for Long-form Video understanding},
author = {Xian Zhang and Zexi Wu and Zinuo Li and Hongming Xu and Luqi Gong and Farid Boussaid and Naoufel Werghi and Mohammed Bennamoun},
journal= {arXiv preprint arXiv:2510.02778},
year = {2025}
}