STORYWARS:面向协作故事理解与生成的数据集及指令微调基线
计算与语言
2023-05-16 v1
摘要
协作故事是由多位具有不同写作风格与意图的作者共同创作而成的文本,对 NLP 模型提出了独特挑战。由于缺乏开放域语料库,理解与生成此类故事仍属未被充分探索的领域。为此,我们引入 STORYWARS,一个来自在线平台、由 9,400 位不同作者撰写的超过 40,000 篇协作故事的新数据集。我们在 STORYWARS 上设计了 12 种任务类型,包含 7 种理解类与 5 种生成类任务类型,由此衍生出总计 101 项多样的故事相关任务,作为一个覆盖全监督、少样本与零样本所有场景的多任务基准。此外,我们提出了针对故事任务的指令微调模型 INSTRUCTSTORY,表明指令微调除了在零样本与少样本场景中取得优越结果外,还能在 STORYWARS 的全监督任务上获得最佳性能,从而在该基准上建立起强劲的多任务表现。
引用
@article{arxiv.2305.08152,
title = {STORYWARS: A Dataset and Instruction Tuning Baselines for Collaborative Story Understanding and Generation},
author = {Yulun Du and Lydia Chilton},
journal= {arXiv preprint arXiv:2305.08152},
year = {2023}
}
备注
ACL 2023