TVStoryGen:一个带有角色描述的故事生成数据集
计算与语言
2022-10-11 v2
摘要
我们介绍TVStoryGen,一个故事生成数据集,要求根据简要摘要和一组描述相关角色的文件生成详细的电视剧集复述。与其他故事生成数据集不同,TVStoryGen包含由专业编剧创作、且具有多个角色间复杂互动的故事。在TVStoryGen中生成故事需要根据简要摘要从提供的冗长角色文档中提取相关信息。此外,我们提出在数据集上训练逆向模型以评估生成故事的忠实性。我们从粉丝贡献的网站创建TVStoryGen,由此收集到26k集复述,平均含1868.7个词元。实证上,我们采用分层故事生成方法,发现使用角色描述预言内容选择器的神经模型在自动指标上表现最佳,显示出本数据集启发未来带约束故事生成研究的潜力。定性分析表明,表现最佳的模型有时会生成与简短摘要不忠实的内容,指明了未来工作的可行方向。
引用
@article{arxiv.2109.08833,
title = {TVStoryGen: A Dataset for Generating Stories with Character Descriptions},
author = {Mingda Chen and Kevin Gimpel},
journal= {arXiv preprint arXiv:2109.08833},
year = {2022}
}