SEED-Story:基于大语言模型的多模态长篇故事生成
计算机视觉与模式识别
2024-10-14 v2
摘要
随着图像生成技术和开放式文本生成技术的显著进步,交错式图像文本内容的创作正在成为日益引人关注的领域。多模态故事生成以以交错方式生成叙述性文本和生动形象的图像而著称,已成为具有广泛应用前景的实用任务。然而,该任务面临着显著挑战,首先需要理解文本与图像之间的复杂相互作用,其次需要生成连贯且在语境上相关的长序列文本和视觉内容。本文提出了 SEED-Story 方法,利用多模态大语言模型(Multimodal Large Language Model,MLLM)生成扩展的多模态故事。该模型基于 MLLM 强大的理解能力,预测文本标记和视觉标记,后者经调整后的视觉解码器处理,以生成具有一致角色和风格的图像。我们进一步提出了多模态注意力沉淀机制,使能够以高度有效的自回归方式生成最长达 25 条序列的故事(仅需训练时 10 条)。此外,我们提供了一个大规模高分辨率数据集,名为 StoryStream,用于训练我们的模型并在各个方面对多模态故事生成任务进行定量评估。
引用
@article{arxiv.2407.08683,
title = {SEED-Story: Multimodal Long Story Generation with Large Language Model},
author = {Shuai Yang and Yuying Ge and Yang Li and Yukang Chen and Yixiao Ge and Ying Shan and Yingcong Chen},
journal= {arXiv preprint arXiv:2407.08683},
year = {2024}
}
备注
Our models, codes and datasets are released in https://github.com/TencentARC/SEED-Story