保持证据链:面向无训练视频时间锚定的语义证据分配
计算机视觉与模式识别
2026-03-09 v1
摘要
视频时间锚定 (Video Temporal Grounding, VTG) 在长篇未剪辑视频中定位查询相关时刻的边界,使得视频-语言模型 (VLM) 流水线变得高昂。虽然最近的无训练视觉 token 剪枝在视频问答中取得了成功,但将这些目标直接应用于 VTG 常导致严重退化,因为 VTG 关键依赖于边界敏感的证据和跨帧推理链。我们因此识别出两种 VTG 特定的剪枝原则:证据保留 (Evidence Retention, ER),保留查询关键的 patch,尤其在事件边界附近;以及连接强度 (Connectivity Strength, CS),保持 token 级别的跨帧连接以实现长程证据聚合。基于这些见解,我们提出了 SemVID,一个无训练剪枝框架,用于构建紧凑且连贯的 token 子集,具有互补的语义角色。SemVID 首先通过平衡查询相关性和帧间变异来分配每帧的 token 预算,以避免过度剪枝的片段,然后选择三类 token:用于多样化查询关键证据的对象 token、捕获有意义转换并作为跨帧中继的运动 token,以及用于场景连续性的少量上下文 token。广泛的实验表明,SemVID 在 VTG 基准上实现了强烈的准确性-效率权衡,在仅使用 12.5% 的视觉 token 时保留最高达 95.4% 的 mIoU,并实现最高达 5.8 倍的 prefill 加速,始终在相同预算下优于先前方法。
引用
@article{arxiv.2603.05663,
title = {Keeping the Evidence Chain: Semantic Evidence Allocation for Training-Free Token Pruning in Video Temporal Grounding},
author = {Jiaqi Li and Shuntian Zheng and Yixian Shen and Jia-Hong Huang and Xiaoman Lu and Minzhe Ni and Yu Guan},
journal= {arXiv preprint arXiv:2603.05663},
year = {2026}
}