中文

FairyTailor:面向讲故事的多模态生成框架

计算与语言 2021-09-17 v1 人工智能 计算机视觉与模式识别

摘要

讲故事是一项开放式任务,需要创造性思维并要求想法的不断涌现。用于讲故事的自然语言生成(NLG)尤其具有挑战性,因为它要求生成的文本在保持创意和多样性以吸引读者的同时,还要遵循整体主题。在这项工作中,我们介绍了一个系统及基于网页的演示程序 FairyTailor,用于人在回路的视觉故事协同创作。用户可以通过将生成的文本和检索到的图像与其输入交织在一起,创作出连贯的儿童童话故事。FairyTailor 增加了另一种模态,并修改了文本生成过程,以产生连贯且富有创意的文本和图像序列。据我们所知,这是第一个允许交互式协同形成文本和图像的多模态故事生成动态工具。它允许用户对协同创作的故事提供反馈并分享他们的结果。

关键词

引用

@article{arxiv.2108.04324,
  title  = {FairyTailor: A Multimodal Generative Framework for Storytelling},
  author = {Eden Bensaid and Mauro Martino and Benjamin Hoover and Hendrik Strobelt},
  journal= {arXiv preprint arXiv:2108.04324},
  year   = {2021}
}

备注

visit https://fairytailor.org/ and https://github.com/EdenBD/MultiModalStory-demo for web demo and source code