RaFoLa:用于检测强迫劳动指标的理由标注语料库
计算与语言
2022-05-06 v1 计算机与社会
摘要
强迫劳动是现代奴隶制中最常见的类型,正日益受到研究界和社会各界的关注。最近的研究表明,人工智能(AI)在增强反奴隶制行动方面具有巨大潜力。然而,AI工具的开发需要不同利益相关者的合作并保持透明。此类工具取决于领域特定数据的可用性和获取,而由于强迫劳动的近乎隐形性质,这类数据十分匮乏。据我们所知,本文提出了首个公开可获取的、用于多类多标签强迫劳动检测的英文标注语料库。该语料库由从专门数据源获取的989篇新闻文章组成,并根据国际劳工组织(ILO)定义的风险指标进行标注。每篇新闻文章针对两个方面进行标注:(1)作为分类标签的强迫劳动指标;(2)证明标注决策的文本片段。我们希望我们的数据集有助于促进多类多标签文本分类可解释性的研究。在这项工作中,我们解释了收集支撑所提语料库数据的过程,描述了我们的标注指南,并展示了其内容的统计分析。最后,我们总结了基于双向编码器表示从Transformer(BERT)模型不同变体的基线实验结果。
引用
@article{arxiv.2205.02684,
title = {RaFoLa: A Rationale-Annotated Corpus for Detecting Indicators of Forced Labour},
author = {Erick Mendez Guzman and Viktor Schlegel and Riza Batista-Navarro},
journal= {arXiv preprint arXiv:2205.02684},
year = {2022}
}