中文

用于抗议规模检测的少样本上采样方法

计算与语言 2021-05-25 v1 机器学习

摘要

我们针对社会科学研究中的一个常见问题提出了一项新任务与数据集:将粗粒度文档标签“上采样”为细粒度标签或跨度。我们以问答形式表述该问题,答案提供细粒度标签。我们在一个具有社会影响的任务上提供了基准数据集与基线:仅给定关于抗议参与人数的数量级信息、极少量细粒度示例以及英文新闻文本,识别美国抗议和示威中的确切人群规模。我们评估了若干基线模型,包括基于规则和问答模型的零样本结果、在少量文档上微调的少样本模型,以及使用较大规模粗标文档的弱监督模型。我们发现基于规则的模型最初优于零样本预训练 transformer 语言模型,但在仅 25 个示例的极少量子集上进一步微调可大幅提升样本外性能。我们还展示了一种仅使用粗标签微调 transformer 跨度的方法,其性能与我们的基于规则的方法相近。本工作将有助于社会科学家生成数据以理解集体行动的成因与成效。

关键词

引用

@article{arxiv.2105.11260,
  title  = {Few-Shot Upsampling for Protest Size Detection},
  author = {Andrew Halterman and Benjamin J. Radford},
  journal= {arXiv preprint arXiv:2105.11260},
  year   = {2021}
}

备注

Accepted into Findings of ACL 2021