LexNLP:面向法律与监管文本的自然语言处理与信息抽取
计算与语言
2018-06-12 v1 信息检索
机器学习
摘要
LexNLP 是一个开源 Python 包,专注于面向法律与监管文本的自然语言处理和机器学习。该包包含以下功能:(i) 文档分段,(ii) 识别标题和章节标题等关键文本,(iii) 抽取距离和日期等十八种以上结构化信息,(iv) 抽取公司与地缘政治实体等命名实体,(v) 将文本转换为用于模型训练的特征,以及 (vi) 构建无监督与有监督模型,如词嵌入或标注模型。LexNLP 包含基于从 SEC EDGAR 数据库以及各类司法与监管程序获取的真实文档中数千个单元测试训练的预训练模型。LexNLP 专为学术研究与工业应用而设计,发布于 https://github.com/LexPredict/lexpredict-lexnlp。
引用
@article{arxiv.1806.03688,
title = {LexNLP: Natural language processing and information extraction for legal and regulatory texts},
author = {Michael J Bommarito and Daniel Martin Katz and Eric M Detterman},
journal= {arXiv preprint arXiv:1806.03688},
year = {2018}
}
备注
9 pages, 0 figures; see also https://github.com/LexPredict/lexpredict-lexnlp