利用域外数据能否减少标注?基于少样本指令的主动与迁移学习
计算与语言
2022-11-23 v1 人工智能
摘要
为毒性和社会偏见的自定义维度标注社交媒体数据具有挑战性且劳动密集。现有的旨在减少标注工作的迁移学习和主动学习方法需要微调,而微调易受噪声过拟合影响,并可能在小样本量下导致域偏移。在本工作中,我们提出一种无需微调的新颖主动迁移少样本指令(ATF)方法。ATF 利用预训练语言模型(PLMs)的内部语言知识,以在对未标注目标数据(目标域任务)最小标注努力下,促进来自现有预标注数据集(源域任务)的信息迁移。我们的策略可产生正向迁移,与无迁移相比,使用大型 22b 参数 PLM 实现了平均 AUC 提升 10.5%。我们进一步表明,通过主动学习标注少量目标域样本有助于迁移,但收益随标注工作量增加而递减(在 100 与 2000 标注样本之间增益下降 26%)。最后,我们发现并非所有迁移场景都产生正向增益,这似乎与 PLM 在目标域任务上的初始表现有关。
引用
@article{arxiv.2211.11798,
title = {Can You Label Less by Using Out-of-Domain Data? Active & Transfer Learning with Few-shot Instructions},
author = {Rafal Kocielnik and Sara Kangaslahti and Shrimai Prabhumoye and Meena Hari and R. Michael Alvarez and Anima Anandkumar},
journal= {arXiv preprint arXiv:2211.11798},
year = {2022}
}
备注
Accepted to NeurIPS Workshop on Transfer Learning for Natural Language Processing, 2022, New Orleans