基于流式标注的训练
计算与语言
2020-04-07 v2
摘要
在本文中,我们处理一种实际场景:训练数据以一系列小规模批次发布,且早期阶段的标注质量低于后期批次。为应对该情况,我们利用预训练的transformer网络来保留并整合来自早期批次的最显著文档信息,同时聚焦于当前批次的标注(预期质量更高)。以事件抽取为案例研究,我们在实验中证明,我们提出的框架表现优于常规方法(绝对F值增益提升幅度为3.6%至14.9%),尤其在早期标注噪声更大时;并且相对于最佳常规方法,我们的方法节省了19.1%的时间。
关键词
引用
@article{arxiv.2002.04165,
title = {Training with Streaming Annotation},
author = {Tongtao Zhang and Heng Ji and Shih-Fu Chang and Marjorie Freedman},
journal= {arXiv preprint arXiv:2002.04165},
year = {2020}
}