InstanceCap:通过实例感知结构描述改进文本到视频生成
计算机视觉与模式识别
2024-12-13 v1 人工智能
摘要
文本到视频生成近年来发展迅速,取得了显著成果。训练通常依赖视频-caption 配对数据,这在提高生成性能方面起着关键作用。然而,当前视频描述常常缺乏细节、存在幻觉且运动描绘不够精确,影响生成视频的保真度和一致性。本文提出一种新颖的实例感知结构描述框架,称为 InstanceCap,首次实现实例级和细粒度视频描述。基于此方案,我们设计了一套辅助模型集群,将原始视频转换为实例,以提高实例保真度。视频实例进一步用于细化稠密提示为结构化短语,实现简洁而精确的描述。此外, curate 了一个 22K 视频实例数据集用于训练,并提出了针对 InstanceCap 结构的推理增强管道。实验结果表明,我们提出的 InstanceCap 在以往模型上显著优于,确保描述与视频之间的高保真度,同时减少幻觉。
引用
@article{arxiv.2412.09283,
title = {InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption},
author = {Tiehan Fan and Kepan Nan and Rui Xie and Penghao Zhou and Zhenheng Yang and Chaoyou Fu and Xiang Li and Jian Yang and Ying Tai},
journal= {arXiv preprint arXiv:2412.09283},
year = {2024}
}