带角色引导与字幕增强的掩码生成式故事Transformer
计算机视觉与模式识别
2024-03-14 v1 人工智能
摘要
故事可视化是一项具有挑战性的生成式视觉任务,既要求生成图像序列中各帧之间的视觉质量,也要求它们之间的一致性。以往方法要么采用某种记忆机制在图像序列的自回归生成过程中维持上下文,要么将角色及其背景的生成分开建模以改善角色渲染。与此相反,我们采用了一种完全并行的Transformer方法,仅依赖与过去和未来字幕的交叉注意力来实现一致性。此外,我们提出了一种角色引导技术,通过在logit空间中组合文本条件和角色条件的logit,以隐式方式聚焦于角色生成。我们还采用了一种由大语言模型执行的字幕增强技术,以增强我们方法的鲁棒性。这些方法的结合在最具代表性的故事可视化基准(Pororo-SV)上,以受限资源取得了多项指标上的最先进结果,同时实现了优于以往方法的计算复杂度。我们定量结果的有效性得到了人类调查的支持。
引用
@article{arxiv.2403.08502,
title = {Masked Generative Story Transformer with Character Guidance and Caption Augmentation},
author = {Christos Papadimitriou and Giorgos Filandrianos and Maria Lymperaiou and Giorgos Stamou},
journal= {arXiv preprint arXiv:2403.08502},
year = {2024}
}