中文

基于视觉规划与词元对齐的以角色为中心的故事可视化

计算机视觉与模式识别 2022-10-25 v4 计算与语言

摘要

故事可视化通过支持基于完整故事生成多张图像,推进了传统的文本到图像生成。该任务要求机器 1) 理解长文本输入,以及 2) 生成全局一致的图像序列以描绘故事内容。一致故事可视化的一个关键挑战是保留故事中至关重要的角色。为应对该挑战,我们提议改编一项近期工作,其用文本到视觉词元(transformer)架构增强 Vector-Quantized Variational Autoencoders (VQ-VAE)。具体而言,我们将文本到视觉词元模块修改为两阶段框架:1) 角色词元规划模型,仅预测角色的视觉词元;2) 视觉词元补全模型,生成剩余的视觉词元序列,并送入 VQ-VAE 以完成图像生成。为鼓励角色出现在图像中,我们进一步以角色词元对齐目标训练该两阶段框架。大量实验与评估表明,所提方法在保留角色方面表现出色,并且与强基线相比能生成更高质量的图像序列。代码可在 https://github.com/sairin1202/VP-CSV 找到。

关键词

引用

@article{arxiv.2210.08465,
  title  = {Character-Centric Story Visualization via Visual Planning and Token Alignment},
  author = {Hong Chen and Rujun Han and Te-Lin Wu and Hideki Nakayama and Nanyun Peng},
  journal= {arXiv preprint arXiv:2210.08465},
  year   = {2022}
}

备注

accepted by EMNLP2022