解决跨领域文本蕴含的数据有限问题
计算与语言
2016-06-09 v1
摘要
我们试图解决某些领域中文本蕴含缺乏标注数据(以及标注成本高)的问题。为此,我们首先(出于实验目的)为临床领域创建了一个蕴含数据集,并创建了一个极具竞争力的有监督蕴含系统 ENT,该系统在两个领域均有效(开箱即用)。然后,我们探索了自训练和主动学习策略,以解决缺乏标注数据的问题。通过自训练,我们成功利用未标注数据,在新闻领域比 ENT 提高了 15% 的 F 分数,在临床数据上提高了 13% 的 F 分数。另一方面,我们的主动学习实验表明,在临床领域仅使用 6.6% 的训练数据,在新闻领域仅使用 5.8% 的训练数据,我们就能匹配(甚至超越)ENT。
引用
@article{arxiv.1606.02638,
title = {Addressing Limited Data for Textual Entailment Across Domains},
author = {Chaitanya Shivade and Preethi Raghavan and Siddharth Patwardhan},
journal= {arXiv preprint arXiv:1606.02638},
year = {2016}
}