波斯语因果语料库(PerCause)及因果检测基准
计算与语言
2021-06-29 v1
摘要
识别文本中的因果要素与因果关系是自然语言处理中具挑战性的问题之一,尤其在波斯语等低资源语言中。本研究为波斯语构建了一个人工标注的因果语料库,包含4446个句子与5128个因果关系,并为每个关系标注了原因、结果以及因果标记(若可能)三个标签。我们利用该语料库训练了一个用于检测因果要素边界的系统。此外,基于该语料库,我们为三种机器学习方法和两种深度学习方法提出了因果检测基准。性能评估表明,最佳总体结果由CRF分类器取得,F值达0.76;最佳准确率由Bi-LSTM-CRF深度学习方法取得,准确率为91.4%。
引用
@article{arxiv.2106.14165,
title = {Persian Causality Corpus (PerCause) and the Causality Detection Benchmark},
author = {Zeinab Rahimi and Mehrnoush ShamsFard},
journal= {arXiv preprint arXiv:2106.14165},
year = {2021}
}
备注
20 pages, 6 figures and 10 tables