中文

面向冲突文本语料库数据挖掘的深度主动学习

计算机与社会 2024-02-05 v1 计算与语言 机器学习

摘要

关于武装冲突及相关过程的高分辨率事件数据,凭借UCDP GED、ACLED等数据集,已彻底改变了政治抗争的研究。然而,这些数据集大多局限于收集时空(高分辨率)和强度数据。由于收集数据的巨大工作量,关于动态过程的信息,如目标、战术、目的等,很少被收集。不过,大多数数据集都依赖于丰富的文本语料库,允许进一步挖掘与每个事件相关的更多信息。本文提出了一种成本低廉且性能卓越的方法,利用主动学习——一种基于顺序(引导式)人工输入迭代改进机器学习模型的过程。采用主动学习逐步训练(微调)一个大型的、仅编码器的语言模型,该模型适用于提取与冲突动态相关的事件子类。该方法显示出与人类(金标准)编码相似的性能,同时将所需的人工标注量减少了高达99%。

关键词

引用

@article{arxiv.2402.01577,
  title  = {Deep Active Learning for Data Mining from Conflict Text Corpora},
  author = {Mihai Croicu},
  journal= {arXiv preprint arXiv:2402.01577},
  year   = {2024}
}

备注

40 pages, 6 figures. Paper presented at the Using LLMs and Text-as-Data in Political Science Research Workshop at the University of Barcelona, 29 January 2024