荷兰语小说与新闻中基于规则与神经共指消解基准评测
计算与语言
2020-11-04 v1
摘要
我们在两个领域的荷兰语数据集上评测了一个基于规则的(Lee et al., 2013)和神经的(Lee et al., 2018)共指系统:文学小说以及新闻/Wikipedia 文本。结果揭示了数据驱动与知识驱动系统的相对优势,以及领域、文档长度和标注方案的影响。神经系统在新闻/Wikipedia 文本上表现最佳,而基于规则的系统在文学上表现最佳。神经系统在有限训练数据和长文档方面存在弱点,而基于规则的系统受标注差异影响。本文使用的代码与模型可在 https://github.com/andreasvc/crac2020 获取。
引用
@article{arxiv.2011.01615,
title = {A Benchmark of Rule-Based and Neural Coreference Resolution in Dutch Novels and News},
author = {Corbèn Poot and Andreas van Cranenburgh},
journal= {arXiv preprint arXiv:2011.01615},
year = {2020}
}
备注
Accepted for CRAC 2020 @ COLING