LFS:面向事件感知和时序多样性的可学习帧选择器用于视频描述
计算机视觉与模式识别
2026-05-08 v2
摘要
视频描述模型将帧转换为视觉标记,并通过大语言模型(LLM)生成描述。由于对所有帧进行编码代价高昂,均匀采样是默认选择,但它在时序覆盖上施加相等权重,忽略了事件分布不均的现实情况。这激励开发可学习帧选择器(LFS),以选择时序上具有多样性和事件相关性的帧。LFS显式建模时序重要性,以平衡时序多样性和事件相关性,采用分层策略确保时序覆盖,同时避免聚类。关键在于,LFS利用来自冻结视频-LLM的描述反馈,以直接优化下游描述质量学习帧选择。此外,我们识别了现有基准与人类认知之间的差距。因此,我们引入ICH-CC,基于仔细设计的疑问构建而来,反映人类对视频的一致理解。实验表明,LFS在两个代表性社区基准和ICH-CC上 consistently 改善了详细视频描述,VDC上提升最高达2.0%,ICH-CC上提升超过4%。此外,我们观察到LFS增强的描述在视频问答任务中表现出 improved performance。总体而言,LFS为详细视频描述提供了有效且易于集成的解决方案。
引用
@article{arxiv.2601.14594,
title = {LFS: Learnable Frame Selector for Event-Aware and Temporally Diverse Video Captioning},
author = {Lianying Chao and Linfeng Yin and Peiyu Ren and Yifan Jiang and Qiaoyu Ren and Dingcheng Shan and Jing-cheng Pang and Sijie Wu and Xubin Li and Kai Zhang and Xin Chen},
journal= {arXiv preprint arXiv:2601.14594},
year = {2026}
}