利用上下文与约束改进人口贩卖网页的地理标记
人工智能
2017-04-20 v1
摘要
从网页中提取地理标签是许多领域中的重要应用。在像人口贩卖这样具有异常语言模型的非法领域,以高准确率和高召回率提取地理标签是一个具有挑战性的问题。在本文中,我们描述了一个地理标签提取框架,其中上下文、约束以及公开可用的 Geonames 知识库在整数线性规划(ILP)模型中协同工作以实现良好性能。在初步实证研究中,与基于机器学习的基线相比,该框架在困难的人口贩卖地理标记任务上将准确率提高了 28.57%,F值提高了 36.9%。该方法已被集成到一个现有的知识库构建系统中,该系统被广泛用于美国执法机构打击人口贩卖。
引用
@article{arxiv.1704.05569,
title = {Using Contexts and Constraints for Improved Geotagging of Human Trafficking Webpages},
author = {Rahul Kapoor and Mayank Kejriwal and Pedro Szekely},
journal= {arXiv preprint arXiv:1704.05569},
year = {2017}
}
备注
6 pages, GeoRich 2017 workshop at ACM SIGMOD conference