基于可微教师的自训练
计算与语言
2022-05-04 v2 机器学习
摘要
自训练在各种半监督和弱监督学习任务中取得了巨大成功。该方法可解释为一个教师-学生框架,其中教师生成伪标签,学生做出预测。两个模型交替更新。然而,这种直接的交替更新规则会导致训练不稳定。这是因为教师的微小变化可能导致学生的显著变化。为解决此问题,我们提出 DRIFT(可微自训练的简称),将教师-学生视为 Stackelberg 博弈。在该博弈中,领导者始终处于比跟随者更有利的位置。在自训练中,学生有助于预测性能,而教师通过生成伪标签控制训练过程。因此,我们将学生视为领导者,教师视为跟随者。领导者通过知晓跟随者的策略(涉及可微伪标签和可微样本权重)来获取其优势。因此,领导者-跟随者的交互可通过 Stackelberg 梯度有效捕获,该梯度通过对跟随者策略求导获得。在半监督和弱监督分类及命名实体识别任务上的实验结果表明,我们的模型大幅优于现有方法。
引用
@article{arxiv.2109.07049,
title = {Self-Training with Differentiable Teacher},
author = {Simiao Zuo and Yue Yu and Chen Liang and Haoming Jiang and Siawpeng Er and Chao Zhang and Tuo Zhao and Hongyuan Zha},
journal= {arXiv preprint arXiv:2109.07049},
year = {2022}
}
备注
NAACL 2022 (Findings)