中文

文本挖掘政策:基于神经信息检索的森林与景观恢复政策议程分类

信息检索 2019-08-08 v1 计算与语言

摘要

数十个国家已承诺到2030年恢复3.5亿公顷土地的生态功能。为了实现如此大规模的实施,多部门利益相关者的价值观和优先事项必须与国家级承诺及其他发展议程相对齐并整合。尽管政策尺度间及利益相关者之间的错位是为人所熟知的恢复实施障碍,但多利益相关者环境中快速推进的政策制定使治理与政策的监测和分析复杂化。在本工作中,我们评估了机器学习在多样化政策文档中识别恢复政策议程的潜力。我们引入了一种无监督神经信息检索架构,其利用迁移学习和词嵌入来创建段落的高维表示。政策议程标签被重新表述为信息检索查询,以便通过段落与查询嵌入之间的余弦相似度阈值对政策进行分类。该方法在马拉维、肯尼亚和卢旺达的31份政策文档中的14个政策议程上取得了0.83的F1分数,表明自动化文本挖掘能够提供可靠、可泛化且高效的恢复政策分析。

关键词

引用

@article{arxiv.1908.02425,
  title  = {Text mining policy: Classifying forest and landscape restoration policy agenda with neural information retrieval},
  author = {John Brandt},
  journal= {arXiv preprint arXiv:1908.02425},
  year   = {2019}
}

备注

In FEED 19 Workshop at KDD 2019. Anchorage, AK, USA, 5 pages