中文

从文本到视频的时间推理迁移

计算机视觉与模式识别 2024-10-10 v1 计算与语言

摘要

视频大语言模型在视频理解方面展现出了有前景的能力,但它们在跟踪时间变化和推理时间关系方面仍然存在困难。虽然先前的研究将这一限制归因于视觉输入的时间编码效率低下,但我们的诊断研究表明,视频表示包含足够的信息,即使是小型探测分类器也能达到完美的准确率。令人惊讶的是,我们发现视频大语言模型时间推理能力的关键瓶颈源于底层大语言模型本身在处理时间概念上的固有困难,这从其在文本时间问答任务上的糟糕表现中可见一斑。基于这一发现,我们引入了文本时间推理迁移方法。T3从现有的图像-文本数据集中合成纯文本格式的多样化时间推理任务,解决了具有复杂时间场景的视频样本稀缺的问题。值得注意的是,在不使用任何视频数据的情况下,T3增强了LongVA-7B的时间理解能力,在具有挑战性的TempCompass基准测试上取得了5.3的绝对准确率提升,使我们的模型能够优于在28,000个视频样本上训练的ShareGPT4Video-8B。此外,增强后的LongVA-7B模型在综合视频基准测试上也取得了有竞争力的性能。例如,它在Video-MME的时间推理任务上达到了49.7的准确率,超过了InternVL-Chat-V1.5-20B和VILA1.5-40B等强大的大规模模型。进一步的分析揭示了文本和视频时间任务性能之间的强相关性,验证了将时间推理能力从文本领域迁移到视频领域的有效性。

关键词

引用

@article{arxiv.2410.06166,
  title  = {Temporal Reasoning Transfer from Text to Video},
  author = {Lei Li and Yuanxin Liu and Linli Yao and Peiyuan Zhang and Chenxin An and Lean Wang and Xu Sun and Lingpeng Kong and Qi Liu},
  journal= {arXiv preprint arXiv:2410.06166},
  year   = {2024}
}

备注

Project page: https://video-t3.github.io