面向种族灭绝相关法庭转录文本的基于主题的段落分类新数据集
计算与语言
2022-04-07 v1 信息检索
摘要
自然语言处理近期的进展在许多不同领域令人瞩目,基于 transformer 的方法为广泛应用设定了新的基准。这一发展也降低了 NLP 社区之外的人们使用各类领域特定应用工具与资源的门槛。然而,一旦研究或专业兴趣超出 readily available 的范围,瓶颈仍在于缺乏带标注的黄金标准语料库。种族灭绝相关研究(也包括对该主题大规模文档集合有访问、探索和检索专业兴趣的专家工作,如律师)便是这样一个领域。我们提出 GTC(Genocide Transcript Corpus,种族灭绝转录语料库),这是首个种族灭绝相关法庭转录标注语料库,具有三个目的:(1) 为社区提供首个参考语料库;(2) 使用基于 state-of-the-art transformer 的方法,为暴力相关证人陈述段落识别这一新分类任务建立基准性能;(3) 探索该领域内迁移学习的初步步骤。我们认为我们的贡献尤其契合今年“面向所有人的语言技术”这一热点主题。
引用
@article{arxiv.2204.02712,
title = {A New Dataset for Topic-Based Paragraph Classification in Genocide-Related Court Transcripts},
author = {Miriam Schirmer and Udo Kruschwitz and Gregor Donabauer},
journal= {arXiv preprint arXiv:2204.02712},
year = {2022}
}
备注
Preprint. Accepted to appear in Proceedings of LREC 2022