中文

ShareGPT4Video:通过更精准的描述改善视频理解与生成

计算机视觉与模式识别 2024-06-07 v1

摘要

我们提出ShareGPT4Video系列,旨在通过稠密且精确的描述,促进大视频语言模型(LVLMs)的视频理解以及文本到视频模型(T2VMs)的视频生成。该系列包括:1)ShareGPT4Video,经精心设计的数据过滤与标注策略开发的4万条GPT4V标注的视频稠密描述,覆盖多样长度与来源的视频。2)ShareCaptioner-Video,一个高效且能干的视频描述模型,标注了480万条高质量审美视频。3)ShareGPT4Video-8B,一个简洁却卓越的LVMM,已在三个前沿视频基准测试中达到SOTA性能。为实现此目标,我们发现除去不可扩展的高成本人类标注者后,仅采用直观的多帧或帧拼接输入策略进行视频描述会导致描述不够细致且可能出现时序混乱。我们认为设计高质量视频描述策略的挑战在于三个方面:1)帧间精准时序变化理解。2)帧内详细内容描述。3)帧数规模的可扩展性,以应对任意长度视频。为此,我们细致设计了一种差分视频描述策略,该策略对生成任意分辨率、宽高比及长度视频的描述稳定、可扩展且高效。基于此,我们构建了ShareGPT4Video,包含4万条高质量视频,覆盖广泛类别,其生成描述涵盖丰富的世界知识、物体属性、摄像机运动,尤其是对事件的详细且精确的时序描述。基于ShareGPT4Video,我们进一步开发了ShareCaptioner-Video,一个优越的描述器,能高效生成任意视频的高质量描述...

关键词

引用

@article{arxiv.2406.04325,
  title  = {ShareGPT4Video: Improving Video Understanding and Generation with Better Captions},
  author = {Lin Chen and Xilin Wei and Jinsong Li and Xiaoyi Dong and Pan Zhang and Yuhang Zang and Zehui Chen and Haodong Duan and Bin Lin and Zhenyu Tang and Li Yuan and Yu Qiao and Dahua Lin and Feng Zhao and Jiaqi Wang},
  journal= {arXiv preprint arXiv:2406.04325},
  year   = {2024}
}

备注

Project Page: https://sharegpt4video.github.io/