从文本中提取测量上下文:地球科学中的机遇与差距发现
信息检索
2017-10-13 v1 人工智能
计算与语言
摘要
我们提出Marve,一个从自然语言文本中提取测量值、单位及相关词汇的系统。Marve使用条件随机场(CRF)识别测量值和单位,随后基于规则的系统在一句话中寻找相关实体、描述符与修饰语。句子词元由无向图模型表示,规则基于连接值与单位到上下文词汇的词性(part-of-speech)和词依赖模式。Marve的独特之处在于关注测量上下文,早期实验证明Marve能够生成高精度的提取且具有强召回率。我们还讨论Marve在细化NASA提出的HyspIRI任务测量需求中的作用,HyspIRI是一个将研究世界生态系统的高光谱红外成像卫星。总体而言,我们与HyspIRI的工作展示了语义测量提取在刻画自然语言大语料中包含的定量讨论的价值。这些提取加速了广泛的跨学科研究,并向科学家暴露新的算法途径与实验细微差别。它们也促进识别由HyspIRI赋能的科学机会,从而导致更高效的科研投资与研究。
引用
@article{arxiv.1710.04312,
title = {Measurement Context Extraction from Text: Discovering Opportunities and Gaps in Earth Science},
author = {Kyle Hundman and Chris A. Mattmann},
journal= {arXiv preprint arXiv:1710.04312},
year = {2017}
}