CodecCap:面向稠密视频字幕的高保真编解码器灵感残差建模
计算机视觉与模式识别
2026-05-27 v1
摘要
现有的视频字幕方法在视觉保真度与冗余性之间难以取得平衡:整体字幕紧凑但丢失细粒度证据,而分段字幕提高覆盖范围但引入重量级冗余。我们提出 CodecCap,一个受编解码器灵感启发的高保真稠密视频字幕框架。类似于视频编解码器,CodecCap 使用关键帧字幕和残差字幕表示视频。关键帧字幕对稳定的视觉上下文进行彻底编码,而残差字幕捕获仅限于局部的动作、运动和变化。这有效地保留了细粒度的视觉证据,同时减少了冗余描述。为量化字幕的保真度,我们引入 VidCapQA,一个包含 14 个能力维度、1000 个问题的字幕后问答基准测试。VidCapQA 上的结果表明,直接由强大的视觉语言模型生成的字幕仍遗漏许多视觉细节,这凸显了字幕表示作为关键瓶颈。实验表明,CodecCap 在相同底层视觉语言模型的条件下显著超越直接字幕,表明关键帧-残差字幕是实现高保真视频语言监督的一种方式。我们进一步使用 CodecCap 构建 CodecVDC-100K,一个包含锚点、残差、场景级和视频级监督的大规模稠密字幕数据集。
引用
@article{arxiv.2605.26967,
title = {CodecCap: High-Fidelity Codec-Inspired Residual Modeling for Dense Video Captioning},
author = {Zihan Lin and Songhe Deng and Shuwei He and Danxiang Zhu and Dan Zhang and Yishu Lei and Xianlong Luo and Shikun Feng and Rui Liu},
journal= {arXiv preprint arXiv:2605.26967},
year = {2026}
}
备注
11 pages, 4 figures