从文本到关键帧:KeyScore 用于多模态帧评分与视频-语言理解
计算机视觉与模式识别
2025-10-13 v2
摘要
选择信息丰富的关键帧对于高效视频理解至关重要,但现有方法往往依赖启发式方法,忽视语义,或产生冗余帧。我们提出 KeyScore,一种感知 captions 驱动的帧评分方法,结合三个互补信号:与 captions 的语义相似性、时空代表性以及情境丢弃影响。应用于大规模视频-文本数据集时,KeyScore 可生成帧级别的重要性评分,从而实现关键帧提取器的训练或引导视频-语言模型。为支持这一目标,我们还提出 STACFP,一种时空自适应聚类方法,可在长视频中生成多样且紧凑的帧提案。KeyScore 与 STACFP 联合使用,可在保留关键内容的同时减少无信息帧,实现更快更准确的推理。我们在三个标准视频-语言基准测试 (MSRVTT、MSVD、DiDeMo) 上进行实验,结果表明,结合 STACFP 与 KeyScore 可实现达 99% 的帧数减率,同时在视频-文本检索、关键帧提取和动作识别任务中超越均匀 8 帧编码器的性能。通过聚焦语义相关帧,本方法提升了效率和性能,实现了可扩展且以 captions 为导向的视频理解。
引用
@article{arxiv.2510.06509,
title = {From Captions to Keyframes: KeyScore for Multimodal Frame Scoring and Video-Language Understanding},
author = {Shih-Yao Lin and Sibendu Paul and Caren Chen},
journal= {arXiv preprint arXiv:2510.06509},
year = {2025}
}
备注
10 pages, 4 figures