面向调查性新闻的多语言信息抽取流水线
计算与语言
2018-09-17 v1
摘要
我们引入一种先进的信息抽取流水线,用于自动处理极大规模的非结构化文本数据以服务于调查性新闻。该流水线作为我们与一家大型德国新闻机构合作开发的 New/s/leak 2.0 软件即将发布的重要版本的新型输入处理器。其使用场景为:记者收到高达数 GB、内容未知的大量文件集合。这些集合可能来自官方文件披露(例如《信息自由法》请求)或非官方数据泄露。我们的软件准备以可视化辅助方式探索该集合,以快速了解数据中潜在的报道线索。它基于实体及其在文档中共现的自动抽取。相较于类似项目,我们聚焦于以下三个主要需求,尤其服务于跨境协作中调查性新闻的使用场景:1)组合多种最先进 NLP 工具进行实体抽取;2)支持最多 40 种语言的多语言文档集;3)从多种文件格式中快速且易用地抽取全文、元数据与实体。
引用
@article{arxiv.1809.00221,
title = {A Multilingual Information Extraction Pipeline for Investigative Journalism},
author = {Gregor Wiedemann and Seid Muhie Yimam and Chris Biemann},
journal= {arXiv preprint arXiv:1809.00221},
year = {2018}
}
备注
EMNLP 2018 Demo. arXiv admin note: text overlap with arXiv:1807.05151