中文

DEXA:以专家动态示例辅助非专家标注者

信息检索 2020-05-19 v1

摘要

基于众包的文本语料库标注的成功取决于确保众包工人经过充分训练以准确执行标注任务。为此,训练标注者的常用方法是提供说明与若干展示任务应如何执行的示例案例(称为 CONTROL 方法)。然而,这些全局定义的“任务级示例” (i) 通常仅覆盖标注任务中遇到的常见情况;且 (ii) 在标注过程中需要众包工人付出努力以寻找当前标注样本的最相关示例。为克服这些局限,我们提出除任务级示例外,还以与当前标注数据样本语义相似的“任务实例级”示例辅助工人(称为动态标注示例,DEXA)。此类动态示例可从专家先前标注的集合中检索,这些集合通常作为金标准数据集可用。我们在医学研究句子中标注重参与者、干预与结果(称为 PIO)的复杂任务上评估 DEXA。动态示例使用 BioSent2Vec(一种特定于生物医学领域的无监督语义句子相似度方法)检索。结果显示:(i) DEXA 方法的工人平均与专家达成比 CONTROL 方法工人高得多的协议度(Cohen's Kappa)(DEXA 中对专家平均 0.68,CONTROL 中为 0.40);(ii) DEXA 方法仅三个多数投票聚合标注即对专家达到 P/I/O 分别为 0.78/0.75/0.69 的实质性协议度(CONTROL 中为 0.73/0.58/0.46)。最后,(iii) 我们获取工人的显式反馈,并表明在大多数情况下(平均 72%)工人认为动态示例有用。

关键词

引用

@article{arxiv.2005.08367,
  title  = {DEXA: Supporting Non-Expert Annotators with Dynamic Examples from Experts},
  author = {Markus Zlabinger and Marta Sabou and Sebastian Hofstätter and Mete Sertkan and Allan Hanbury},
  journal= {arXiv preprint arXiv:2005.08367},
  year   = {2020}
}

备注

4 pages, 1 figure, 3 tables, accepted to SIGIR2020