中文

基于多幅图像的多模态故事生成

计算与语言 2021-06-08 v2 计算机视觉与模式识别 机器学习 机器学习

摘要

传统上,文本生成模型以文本序列作为输入,并利用预训练参数迭代生成下一个最可能的词。在这项工作中,我们提出了一种以图像而非文本作为文本生成模型输入的架构,称为 StoryGen。在该架构中,我们设计了一种关联多幅图像不同特征的关系型文本数据生成算法。模型的输出样本展示了生成包含从输入图像中提取特征的连贯文本段落的能力。这是一篇本科项目报告。2019 年 12 月完成于库珀联盟学院。

关键词

引用

@article{arxiv.2001.10980,
  title  = {Multimodal Story Generation on Plural Images},
  author = {Jing Jiang},
  journal= {arXiv preprint arXiv:2001.10980},
  year   = {2021}
}

备注

This is an undergraduate project report. Completed Dec. 2019 at the Cooper Union