德语新闻文章中的引语归属数据集
计算与语言
2024-04-26 v1
摘要
在当今在线新闻文章等海量数据中,提取“谁对谁说了什么”是分析人类交流的关键部分。然而,德语新闻文章中针对此任务的标注数据缺乏,严重限制了可能系统的质量和可用性。为了弥补这一点,我们提出了一个基于 WIKINEWS 的全新、免费、知识共享许可的德语新闻文章引语归属数据集。该数据集在 1000 篇文档(250,000 个 token)中提供了经过精心整理的高质量标注,采用细粒度的标注模式,使该数据集能够用于各种下游任务。标注不仅指明了谁说了什么,还指明了如何说、在何种语境下、对谁说,并定义了引语的类型。我们详细说明了标注模式,描述了数据集的创建过程,并提供了定量分析。此外,我们描述了合适的评估指标,应用了两个现有的引语归属系统,讨论了它们的结果以评估我们数据集的效用,并概述了我们的数据集在下游任务中的用例。
引用
@article{arxiv.2404.16764,
title = {Dataset of Quotation Attribution in German News Articles},
author = {Fynn Petersen-Frey and Chris Biemann},
journal= {arXiv preprint arXiv:2404.16764},
year = {2024}
}
备注
To be published at LREC-COLING 2024