PiTe:基于像素-时序对齐的大型视频语言模型
计算机视觉与模式识别
2024-09-12 v1
摘要
在大语言模型(LLMs)浪潮的推动下,大型视觉语言模型(LVLMs)已成为关键性进步,填补了图像与文本之间的鸿沟。然而,视频数据使 LVLMs 难以充分发挥作用,因其语言与时空数据结构之间的复杂关系。最近的大型视频语言模型(LVidLMs)通过通用多模态任务将静态视觉特征对齐至语言特征空间,以充分利用 LLMs 的能力。本文探索一种通过对象轨迹在空间和时间维度上同时进行细粒度对齐的方法。因此,我们提出一种新颖的 LVidLM,称为 PiTe,即受轨迹引导的像素-时序对齐,展现出良好的模型适用性。为实现细粒度视频语言对齐,我们构建了一个多模态预训练数据集 PiTe-143k,该数据集通过自动标注管道为所有出现于视频和描述中的单个对象的移动轨迹在像素级别进行标注。与此同时,PiTe 在众多视频相关多模态任务上展现惊人的能力,通过大幅超越现有最先进方法实现。
引用
@article{arxiv.2409.07239,
title = {PiTe: Pixel-Temporal Alignment for Large Video-Language Model},
author = {Yang Liu and Pengxiang Ding and Siteng Huang and Min Zhang and Han Zhao and Donglin Wang},
journal= {arXiv preprint arXiv:2409.07239},
year = {2024}
}