利用文本分类与主动学习支持废弃露天采矿场的土地再利用
计算与语言
2022-03-23 v4
摘要
露天采矿使全球许多地区变得不宜居或无法居住。为使这些地区重新得到利用,必须对整个片区的土地进行自然恢复。为实现可持续的后续利用或转为新的主要用途,大量污染场地和土壤信息必须被永久管理。在大多数情况下,这些信息以非结构化数据集合或文件文件夹中的专家报告形式存在,最好情况已被数字化。由于数据的规模和复杂性,单个人难以全面掌握这些数据以做出可靠判断。这是阻碍这些区域快速转入后续利用的最重要障碍之一。基于信息的方法有助于实现若干关于环境、健康和气候行动的可持续发展目标。我们使用光学字符识别、文本分类、主动学习和地理信息系统可视化的技术栈来有效挖掘和可视化这些信息。随后,我们将提取的信息与地理坐标关联,并使用地理信息系统进行可视化。主动学习起着至关重要的作用,因为我们的数据集不提供训练数据。我们总共处理九个类别,并在数据集中主动学习其表示。我们分别评估了 OCR、主动学习和文本分类以报告系统性能。主动学习和文本分类的结果具有两面性:关于限制条件的类别表现充分(.85 F1),而七个面向主题的类别对人类编码者而言较为复杂,因此所得评估分数平平(.70 F1)。
引用
@article{arxiv.2105.05557,
title = {Supporting Land Reuse of Former Open Pit Mining Sites using Text Classification and Active Learning},
author = {Christopher Schröder and Kim Bürgl and Yves Annanias and Andreas Niekler and Lydia Müller and Daniel Wiegreffe and Christian Bender and Christoph Mengs and Gerik Scheuermann and Gerhard Heyer},
journal= {arXiv preprint arXiv:2105.05557},
year = {2022}
}