中文

基于流式标注的训练

计算与语言 2020-04-07 v2

摘要

在本文中,我们处理一种实际场景:训练数据以一系列小规模批次发布,且早期阶段的标注质量低于后期批次。为应对该情况,我们利用预训练的transformer网络来保留并整合来自早期批次的最显著文档信息,同时聚焦于当前批次的标注(预期质量更高)。以事件抽取为案例研究,我们在实验中证明,我们提出的框架表现优于常规方法(绝对F值增益提升幅度为3.6%至14.9%),尤其在早期标注噪声更大时;并且相对于最佳常规方法,我们的方法节省了19.1%的时间。

关键词

引用

@article{arxiv.2002.04165,
  title  = {Training with Streaming Annotation},
  author = {Tongtao Zhang and Heng Ji and Shih-Fu Chang and Marjorie Freedman},
  journal= {arXiv preprint arXiv:2002.04165},
  year   = {2020}
}