Goldilocks:面向技术辅助评审的 BERT 恰到好处调优
信息检索
2022-01-21 v2 计算与语言
摘要
技术辅助评审(TAR)指高召回检索(HRR)任务中文档评审的迭代主动学习工作流。TAR 研究与多数商业 TAR 软件将线性模型(如逻辑回归)应用于词法特征。基于 Transformer 的模型经监督调优已知可提升许多文本分类任务的效果,暗示其在 TAR 中的使用。我们确实发现,在 RCV1-v2 新闻专线语料上模拟的 TAR 工作流中,预训练 BERT 模型将评审成本降低 10% 至 15%。相反,我们同样确定,在 Jeb Bush 电子邮件语料上模拟的法律发现主题中,线性模型优于 BERT。这表明 Transformer 预训练语料与任务领域之间的匹配比通常所认为的更为关键。此外,我们展示在启动主动学习前对任务语料进行恰到好处的语言模型微调至关重要。过少或过多的微调都会妨碍性能,甚至比线性模型更差,即便对于如 RCV1-v2 这样的有利语料亦然。
引用
@article{arxiv.2105.01044,
title = {Goldilocks: Just-Right Tuning of BERT for Technology-Assisted Review},
author = {Eugene Yang and Sean MacAvaney and David D. Lewis and Ophir Frieder},
journal= {arXiv preprint arXiv:2105.01044},
year = {2022}
}
备注
6 pages, 1 figure, accepted at ECIR 2022