用于命名实体识别的德语法学文档数据集
计算与语言
2020-03-31 v1 信息检索
摘要
我们描述了一个为德联邦法院判决中的命名实体识别(NER)所开发的数据集。其包含约67,000个句子,超过200万个词符。该资源含有54,000个人工标注的实体,映射到19个细粒度语义类:人、法官、律师、国家、城市、街道、地貌、组织、公司、机构、法院、品牌、法律、条例、欧洲法律规范、规章、合同、法院判决和法学文献。此外,这些法律文档还使用基于TimeML的时间表达式自动标注了超过35,000个时间表达式。该数据集以CoNLL-2002格式在CC-BY 4.0许可下提供,是为欧盟Lynx项目中训练德语法律文档NER服务而开发的。
引用
@article{arxiv.2003.13016,
title = {A Dataset of German Legal Documents for Named Entity Recognition},
author = {Elena Leitner and Georg Rehm and Julián Moreno-Schneider},
journal= {arXiv preprint arXiv:2003.13016},
year = {2020}
}
备注
Proceedings of the 12th Language Resources and Evaluation Conference (LREC 2020). To appear