中文

TimeChat-Online:流式视频中 80% 视觉标记天然冗余

计算机视觉与模式识别 2025-04-25 v1

摘要

在线视频平台的快速增长,尤其是直播服务,正在催生对实时视频理解系统的迫切需求。这些系统必须处理持续的视频流并即时响应用户查询,这为当前视频大语言模型(VideoLLM)带来了独特挑战。虽然现有的 VideoLLM 在处理完整视频方面表现出色,但由于无法有效处理密集、冗余的帧,在流式场景中面临重大限制。我们引入 TimeChat-Online,一款革命性的在线 VideoLLM,以其创新的差分标记丢弃(DTD)模块为核心,解决了流式视频中视觉冗余的根本挑战。DTD 借鉴了人类视觉感知中的“视觉隐形”现象,保留有意义的时序变化,同时过滤掉帧之间静态、冗余的内容。令人惊讶的是,我们的实验表明,DTD 在 StreamingBench 上实现了 82.8% 的视频标记减少,同时保持 98% 的性能,揭示了在不要求语言指导的情况下,流式视频中超过 80% 的视觉内容是天然冗余的。为实现无缝的实时交互,我们提出 TimeChat-Online-139K,一个综合性的流式视频数据集,包含多样化的交互模式,包括反向追踪、当前感知和未来响应场景。TimeChat-Online 独特的主动响应能力,通过 DTD 持续监控视频场景转换自然实现,与传统方法各不相同。我们的广泛评估显示,TimeChat-Online 在流式基准测试(StreamingBench 和 OvOBench)上表现卓越,并在诸如 Video-MME 和 MLVU 等长视频任务上保持竞争成绩。

关键词

引用

@article{arxiv.2504.17343,
  title  = {TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos},
  author = {Linli Yao and Yicheng Li and Yuancheng Wei and Lei Li and Shuhuai Ren and Yuanxin Liu and Kun Ouyang and Lean Wang and Shicheng Li and Sida Li and Lingpeng Kong and Qi Liu and Yuanxing Zhang and Xu Sun},
  journal= {arXiv preprint arXiv:2504.17343},
  year   = {2025}
}