中文

LITA:语言指示的时序定位助手

计算机视觉与模式识别 2024-03-29 v1 人工智能

摘要

多模态大语言模型取得了巨大进展。最近的工作将这些模型扩展到视频输入,展现出了有前景的指令跟随能力。然而,一个重要的缺失部分是时序定位。这些模型无法准确回答“何时?”的问题。我们确定了限制其时序定位能力的三个关键方面: 时间表示, 架构,以及 数据。我们通过提出语言指示的时序定位助手(LITA)来解决这些缺陷,其具有以下特征: 我们引入了时间令牌,该令牌编码相对于视频长度的时间戳,以更好地表示视频中的时间。 我们在架构中引入 SlowFast 令牌,以在精细的时间分辨率下捕获时序信息。 我们强调了 LITA 的时序定位数据。除了利用带有时间戳的现有视频数据集外,我们还提出了一项新任务,即推理时序定位(RTL),并连同数据集 ActivityNet-RTL 一起用于学习和评估该任务。推理时序定位需要 Video LLMs 具备推理能力和时序定位能力。LITA 在这项具有挑战性的任务上表现出色,将基线的时间平均交并比几乎提高了一倍。此外,我们表明,与现有的 Video LLMs 相比,我们对时序定位的强调也显著改善了基于视频的文本生成,其中时间理解方面实现了 36% 的相对提升。代码获取地址:https://github.com/NVlabs/LITA

关键词

引用

@article{arxiv.2403.19046,
  title  = {LITA: Language Instructed Temporal-Localization Assistant},
  author = {De-An Huang and Shijia Liao and Subhashree Radhakrishnan and Hongxu Yin and Pavlo Molchanov and Zhiding Yu and Jan Kautz},
  journal= {arXiv preprint arXiv:2403.19046},
  year   = {2024}
}