CompRes:面向新闻叙事结构的数据集
计算与语言
2023-11-08 v2
摘要
本文致力于自动检测原始文本中的叙事结构。先前工作利用 Labov 与 Waletzky 的口头叙事理论来识别个人故事文本中的各类叙事要素。与之不同,我们将注意力转向新闻文章,其动机在于新闻日益增长的社会影响以及其在形成与塑造公众舆论中的作用。我们推出 CompRes——首个面向新闻媒体叙事结构的数据集。我们描述了该数据集的构建过程:首先,通过改编 Labov 与 Waletzky 叙事理论中的要素(冲突与解决)并新增自有叙事要素(成功),设计了一套更适配新闻媒体的新叙事标注方案;随后,使用该方案标注了一组从新闻与党派网站收集的 29 篇英文新闻文章(含 1,099 个句子)。我们利用标注数据集训练若干监督模型以识别不同叙事要素,取得最高 0.7 的 分数。最后,我们提出了若干值得展望的未来工作方向。
引用
@article{arxiv.2007.04874,
title = {CompRes: A Dataset for Narrative Structure in News},
author = {Effi Levi and Guy Mor and Shaul Shenhav and Tamir Sheafer},
journal= {arXiv preprint arXiv:2007.04874},
year = {2023}
}
备注
Please refer to a more recent and updated paper (and a link to the dataset) at arXiv:2210.03028. Accpted to the First Joint Workshop on Narrative Understanding, Storylines, and Events, ACL 2020