中文

人类与计算机语篇结构的新语料库

计算与语言 2021-11-12 v1

摘要

我们提出了一个包含445篇人类与计算机生成文档的新语料库,约含27,000个从句,标注了语义从句类型与连贯关系,可用于对人工与自然语篇模式进行细致比较。该语料库涵盖正式与非正式语篇,并包含使用微调的GPT-2 (Zellers et al., 2019) 与GPT-3 (Brown et al., 2020) 生成的文档。我们提供了初步证据,表明从句关系数量更少、更短且更常不连贯,与计算机生成的叙事和论证的较低感知质量相关,从而展示了该语料库在文本生成细致语篇分析中的效用。

关键词

引用

@article{arxiv.2111.05940,
  title  = {A Novel Corpus of Discourse Structure in Humans and Computers},
  author = {Babak Hemmatian and Sheridan Feucht and Rachel Avram and Alexander Wey and Muskaan Garg and Kate Spitalnic and Carsten Eickhoff and Ellie Pavlick and Bjorn Sandstede and Steven Sloman},
  journal= {arXiv preprint arXiv:2111.05940},
  year   = {2021}
}

备注

In the 2nd Workshop on Computational Approaches to Discourse (CODI) at EMNLP 2021 (extended abstract). 3 pages