自然语言文本中因果关系抽取综述
信息检索
2021-11-02 v2 计算与语言
摘要
作为人类认知的基本组成部分,因果关系在文本中频繁出现,从文本中整理因果关系有助于构建用于预测任务的因果网络。现有的因果抽取技术包括基于知识、基于统计机器学习(ML)和基于深度学习的方法。每种方法各有优劣。例如,基于知识的方法可解释性强,但需要大量人工领域知识且跨领域适用性差。统计机器学习方法因自然语言处理(NLP)工具包而更自动化。然而,特征工程劳动密集,且工具包可能导致错误传播。过去几年,深度学习技术因其强大的表示学习能力以及计算资源的快速增长而受到 NLP 研究者的广泛关注。其局限性包括高计算成本以及缺乏充足的标注训练数据。本文对因果抽取进行了全面综述。我们首先介绍因果抽取中存在的主要形式:显式句内因果、隐式因果和句间因果。接着,列出用于因果关系抽取的基准数据集与建模评估方法。然后,结构化概述三类方法及其代表性系统。最后,指出当前存在的开放挑战及潜在方向。
引用
@article{arxiv.2101.06426,
title = {A Survey on Extraction of Causal Relations from Natural Language Text},
author = {Jie Yang and Soyeon Caren Han and Josiah Poon},
journal= {arXiv preprint arXiv:2101.06426},
year = {2021}
}