中文

ARCH:基于缓存的高效对抗正则化训练

计算与语言 2022-04-21 v2

摘要

对抗正则化可改善许多自然语言处理任务中的模型泛化能力。然而,传统方法计算开销大,因为它们需要在每个 epoch 为每个样本生成扰动。我们提出一种新的对抗正则化方法 ARCH(带缓存的对抗正则化),其中扰动每若干 epoch 生成并缓存一次。由于缓存所有扰动会带来内存使用问题,我们采用基于 K 近邻的策略来解决该问题。该策略仅需缓存少量扰动,且不引入额外的训练时间。我们在一组神经机器翻译和自然语言理解任务上评估了所提方法。我们观察到 ARCH 显著减轻了计算负担(与传统方法相比最多节省 70% 的计算时间)。更令人惊讶的是,通过降低随机梯度的方差,ARCH 产生了明显更好(在大多数任务上)或相当的模型泛化能力。我们的代码可在 https://github.com/SimiaoZuo/Caching-Adv 获取。

关键词

引用

@article{arxiv.2109.07048,
  title  = {ARCH: Efficient Adversarial Regularized Training with Caching},
  author = {Simiao Zuo and Chen Liang and Haoming Jiang and Pengcheng He and Xiaodong Liu and Jianfeng Gao and Weizhu Chen and Tuo Zhao},
  journal= {arXiv preprint arXiv:2109.07048},
  year   = {2022}
}

备注

EMNLP 2021 (findings)