中文

DisTime:面向视频大语言模型的基于分布的时间表示

计算机视觉与模式识别 2025-08-01 v2

摘要

尽管在通用视频理解方面取得了进展,但由于离散的时间表示和有限的时间感知数据集,视频大语言模型在精确时间定位上仍面临挑战。现有的时间表达方法要么将时间与基于文本的数值混为一谈,要么添加一系列专用时间 token,要么使用专门的时间定位头回归时间。为了解决这些问题,我们引入了 DisTime,这是一个旨在增强 Video-LLM 时间理解能力的轻量级框架。DisTime 采用可学习的 token 创建连续的时间嵌入空间,并结合基于分布的时间解码器生成时间概率分布,有效缓解了边界模糊性并保持了时间连续性。此外,基于分布的时间编码器对时间戳进行重新编码,为 Video-LLM 提供时间标记。为了克服现有数据集在时间粒度上的限制,我们提出了一种自动标注范式,将 Video-LLM 的字幕生成能力与专用时间模型的定位专长相结合。这促成了 InternVid-TG 数据集的构建,这是一个包含 179k 个视频中 1.25M 个时间定位事件的大型数据集,规模是 ActivityNet-Caption 的 55 倍。大量实验表明,DisTime 在三项时间敏感任务的基准测试中均取得了 SOTA 性能,同时在视频问答任务中保持了具有竞争力的性能。代码和数据已发布于 https://github.com/josephzpng/DisTime。

关键词

引用

@article{arxiv.2505.24329,
  title  = {DisTime: Distribution-based Time Representation for Video Large Language Models},
  author = {Yingsen Zeng and Zepeng Huang and Yujie Zhong and Chengjian Feng and Jie Hu and Lin Ma and Yang Liu},
  journal= {arXiv preprint arXiv:2505.24329},
  year   = {2025}
}

备注

Accepted by ICCV 2025