中文

TALC:用于多场景文本到视频生成的时间对齐标题

计算机视觉与模式识别 2024-11-11 v4 人工智能 机器学习

摘要

大多数文本到视频(T2V)生成模型通常产生单场景视频片段, depicting 一个实体执行特定动作(例如,'a red panda climbing a tree')。然而,生成多场景视频非常重要,因为这在现实世界中十分常见(例如,'a red panda climbing a tree' 后接着 'the red panda sleeps on the top of the tree')。为从预训练的 T2V 模型生成多场景视频,我们引入了一个简单且有效的 Time-Aligned Captions(TALC)框架。具体而言,我们增强了 T2V 架构中的文本条件化机制,以识别视频场景与场景描述之间的时间对齐。例如,我们将生成视频的早期和后期视觉特征分别条件化于第一个场景描述(例如,'a red panda climbing a tree')和第二个场景描述(例如,'the red panda sleeps on the top of the tree')的表示。结果表明,TALC 框架使 T2V 模型能够生成符合多场景文本描述且在视觉上一致(例如,实体和背景)的多场景视频。进一步,我们使用 TALC 框架对预训练的 T2V 模型进行多场景视频文本数据上的微调。我们展示了 TALC 微调后的模型相对于基线模型在整体得分上实现了约 29% 的相对提升,该得分平均衡量了视觉一致性和文本遵循性,使用人类评估进行评估。

关键词

引用

@article{arxiv.2405.04682,
  title  = {TALC: Time-Aligned Captions for Multi-Scene Text-to-Video Generation},
  author = {Hritik Bansal and Yonatan Bitton and Michal Yarom and Idan Szpektor and Aditya Grover and Kai-Wei Chang},
  journal= {arXiv preprint arXiv:2405.04682},
  year   = {2024}
}

备注

22 pages, 14 figures, 11 tables