中文

UFVideo:面向统一细粒度视频协同理解的视频大语言模型

计算机视觉与模式识别 2026-03-25 v2

摘要

随着多模态大语言模型(LLM)的发展,视频LLM已进一步发展用于整体性和专门化的视频理解。然而,现有工作仅限于专门化的视频理解任务,未能实现全面且多粒度的视频感知。为弥补这一差距,我们提出了UFVideo——首个具备统一多粒度协同理解能力的视频LLM。具体而言,我们设计了统一的视觉-语言引导对齐,以在单一模型中灵活处理跨越全局、像素和时间尺度的视频理解。UFVideo动态编码不同任务的视觉和文本输入,并生成文本响应、时间定位或定位掩码。此外,为评估具有挑战性的多粒度视频理解任务,我们构建了UFVideo-Bench,其中包含三个不同尺度内的协同任务,展示了UFVideo的灵活性及其相对于GPT-4o的优势。进一步地,我们在涵盖各种常见视频理解任务的9个公开基准上验证了模型的有效性,为未来的视频LLM提供了有价值的见解。

关键词

引用

@article{arxiv.2512.11336,
  title  = {UFVideo: Towards Unified Fine-Grained Video Cooperative Understanding with Large Language Models},
  author = {Hewen Pan and Cong Wei and Dashuang Liang and Zepeng Huang and Pengfei Gao and Ziqi Zhou and Lulu Xue and Pengfei Yan and Xiaoming Wei and Minghui Li and Shengshan Hu},
  journal= {arXiv preprint arXiv:2512.11336},
  year   = {2026}
}

备注

CVPR 2026 Camera Ready, Github Code: https://github.com/Heven-Pan/UFVideo