TAC 2018 中 EP 团队:环境因子系统综述中数据抽取的自动化
计算与语言
2019-01-09 v1 机器学习
摘要
我们描述了参加 2018 年文本分析会议(Text Analysis Conference)系统综述信息抽取赛道(Systematic Review Information Extraction track)的方案。我们的解决方案是一个基于 BI-LSTM-CRF 架构的端到端深度学习序列标注模型。然而,我们使用带高速连接(highway connections)的交错、交替 LSTM 层,而非更传统的将双向最后隐状态拼接作为下一层输入的方法。我们还广泛使用了预训练词嵌入,即 GloVe 与 ELMo。借助若干正则化技术,我们得以在训练集规模(100 篇文档,少于 200K 词符)下实现相对较大的模型容量(31.3M+ 可训练参数)。系统的官方得分为 60.9%(micro-F1),在任务 1 中排名第一。此外,在纠正提交格式中的一个明显错误后,系统得分为 67.35%。
引用
@article{arxiv.1901.02081,
title = {Team EP at TAC 2018: Automating data extraction in systematic reviews of environmental agents},
author = {Artur Nowak and Paweł Kunstman},
journal= {arXiv preprint arXiv:1901.02081},
year = {2019}
}
备注
7 pages, 3 figures, to appear in the proceedings of Text Analysis Conference (TAC) 2018