Cut the CARP:零样本故事评估探究
计算与语言
2021-10-27 v3
摘要
大规模语言模型的最新进展(Raffel et al., 2019; Brown et al., 2020)为机器驱动文本生成带来了质与量的显著改善。尽管如此,机器生成叙事文本的生成与评估仍具挑战性。对计算生成故事的客观评估可能极其昂贵,需要精细标注的数据集,或可能无法充分衡量生成故事叙事结构的逻辑连贯性。受对比学习近期进展(Radford et al., 2021)启发,我们提出 Contrastive Authoring and Reviewing Pairing(CARP):一种可扩展、高效的方法,用于执行质量更优的零样本故事评估。我们展示了人类故事评估与 CARP 评估间的强相关性。模型输出比那些基于语言模型且采用微调或提示工程方法的方法更显著地相关于对应人类输入。我们还提出并分析了 Story-Critique Dataset,一个由超过 80,000 篇故事衍生的 130 万对齐故事-评论对组成的新语料库。我们期望该语料库能引起 NLP 研究者的兴趣。
引用
@article{arxiv.2110.03111,
title = {Cut the CARP: Fishing for zero-shot story evaluation},
author = {Shahbuland Matiana and JR Smith and Ryan Teehan and Louis Castricato and Stella Biderman and Leo Gao and Spencer Frazier},
journal= {arXiv preprint arXiv:2110.03111},
year = {2021}
}
备注
9 pages, 4 figures