信息性文本中叙事元素的检测
计算与语言
2022-10-07 v1
摘要
将叙事理论与计算模型相结合的文本叙事元素自动抽取,在过去几年中受到越来越多的关注。已有工作利用 Labov 与 Waletzky 的口头叙事理论来识别个人故事文本中的各类叙事元素。与之不同,我们将焦点转向信息性文本,具体而言是新闻故事。我们提出 NEAT(Narrative Elements AnnoTation,叙事元素标注)——一项用于检测原始文本中叙事元素的新 NLP 任务。为此,我们通过改编 Labov 与 Waletzky 叙事理论中的元素(冲突与解决)并新增我们自己的叙事元素(成功),设计了一套更适用于信息性文本(如新闻媒体)的多标签叙事标注方案。随后,我们利用该方案标注了一个包含 2,209 个句子的新数据集,这些句子编译自 46 篇不同类别领域的新闻文章。我们在标注数据集上以多种设置训练了若干监督模型以识别不同叙事元素,取得了最高 0.77 的平均 F1 分数。结果证明了我们标注方案的整体性及其对领域类别的鲁棒性。
引用
@article{arxiv.2210.03028,
title = {Detecting Narrative Elements in Informational Text},
author = {Effi Levi and Guy Mor and Tamir Sheafer and Shaul R. Shenhav},
journal= {arXiv preprint arXiv:2210.03028},
year = {2022}
}
备注
Accepted to Finding of NAACL 2022. Dataset is available at https://github.com/efle/NEAT. arXiv admin note: substantial text overlap with arXiv:2007.04874