中文

STORIUM:一个用于人机协作故事生成的数据集与评测平台

计算与语言 2020-10-06 v1 人机交互

摘要

故事生成系统被要求根据给定输入上下文生成合理且有趣的故事。该任务定义不足,因为从单一输入可衍生出大量不同的故事。巨大的输出空间使得构建和评估故事生成模型十分困难,因为(1)现有数据集缺乏足够丰富的上下文来有效引导模型,(2)现有评测(包括众包和自动评测)在评估长篇幅创造性文本时并不可靠。为解决这些问题,我们引入了基于在线协作叙事社区 STORIUM 构建的数据集与评测平台。我们由作者生成的数据集包含 6K 篇长篇故事(125M tokens),其中贯穿每篇叙事穿插了细粒度的自然语言标注(如角色目标与属性),构成了引导模型的稳健来源。我们将在数据集上微调的语言模型集成到 STORIUM 上进行评测,真实作者可查询模型以获取建议的故事续写并进行编辑。在这些编辑上计算的自动指标与生成故事的用户评分以及半结构化用户访谈的定性反馈均良好相关。我们发布 STORIUM 数据集与评测平台,以推动对故事生成更原理性的研究。

关键词

引用

@article{arxiv.2010.01717,
  title  = {STORIUM: A Dataset and Evaluation Platform for Machine-in-the-Loop Story Generation},
  author = {Nader Akoury and Shufan Wang and Josh Whiting and Stephen Hood and Nanyun Peng and Mohit Iyyer},
  journal= {arXiv preprint arXiv:2010.01717},
  year   = {2020}
}

备注

Accepted as a long paper to EMNLP 2020