中文

无需词典创建自定义事件数据:一组技巧

计算与语言 2023-04-05 v1

摘要

事件数据,或从文本中自动抽取的“谁对谁做了什么”的结构化记录,是国际政治学者的一个重要数据来源。开发新事件数据集的高成本,尤其是使用依赖手工构建词典的自动化系统,意味着多数研究者依赖如 ICEWS 等大型既有数据集,而非开发针对其特定研究问题优化的定制事件数据集。本文描述一组用于高效定制事件数据生产的“技巧”,借鉴自然语言处理(NLP)近期进展,使研究者能快速生成定制事件数据集。本文介绍利用主动学习训练事件类别分类器、使用大语言模型与标准机器学习分类器及 NLP 中预训练的“问答”模型识别文本中行动者与动作接受者、以及将行动者指称解析至其维基百科条目以分类的技术。我们描述这些技术如何产生旨在替代 ICEWS 的新 POLECAT 全球事件数据集,并附学者可快速生成较小定制事件数据集的示例。我们发布实现新技术的示例代码与模型。

关键词

引用

@article{arxiv.2304.01331,
  title  = {Creating Custom Event Data Without Dictionaries: A Bag-of-Tricks},
  author = {Andrew Halterman and Philip A. Schrodt and Andreas Beger and Benjamin E. Bagozzi and Grace I. Scarborough},
  journal= {arXiv preprint arXiv:2304.01331},
  year   = {2023}
}