中文

SF2T:基于自监督片段微调的视频大语言模型精细理解

计算机视觉与模式识别 2025-04-11 v1 人工智能

摘要

视频大语言模型(Video-LLMs)在近年来由于多模态大语言模型的发展而取得了显著进展。尽管这些模型在提供视频整体描述方面表现出色,但在细粒度理解方面仍存在挑战,尤其是涉及视觉动态性和视频细节查询的问题。为克服这些不足,我们发现对视频大语言模型进行自监督片段任务的微调能显著提升其细粒度视频理解能力。因此,我们提出了两个关键贡献:(1) 自监督片段微调(SF²T),一种新颖且无需繁琐微调的方法,利用视频内在丰富的特征进行训练,同时发掘视频大语言模型更细粒度的理解能力;此外,它无需人工标注,巧妙地规避了自然语言常常难以捕捉视频中复杂时空变化的限制;(2) 一种新颖的基准数据集,即 FineVidBench,用于严格评估视频大语言模型在场景和片段水平的性能,提供了全面的评估。我们对多种模型进行了评估,并验证了 SF²T 在其上的有效性。实验结果表明,我们的方法提升了模型捕捉和解释时空细节的能力。

关键词

引用

@article{arxiv.2504.07745,
  title  = {SF2T: Self-supervised Fragment Finetuning of Video-LLMs for Fine-Grained Understanding},
  author = {Yangliu Hu and Zikai Song and Na Feng and Yawei Luo and Junqing Yu and Yi-Ping Phoebe Chen and Wei Yang},
  journal= {arXiv preprint arXiv:2504.07745},
  year   = {2025}
}

备注

Accepted to CVPR2025