中文

从注意力汇聚视角看 RoBERTa 是否在持续学习中优于 BERT

机器学习 2024-10-10 v1 计算与语言

摘要

持续学习(Continual Learning, CL)旨在训练能够依次学习新任务且不忘记先前任务知识的模型。尽管前期研究观察到预训练可益处于 CL,但是否具有更高下游能力的预训练模型也在 CL 中表现更好仍是未知之谜。本文我们观察到,预训练模型可能为某些“汇聚”token(如 [SEP] token)分配高注意力得分,这些 token 在各种任务中普遍存在。此类注意力汇聚可能导致模型在单任务学习中出现过平滑,并在顺序任务学习中产生干扰,这可能削弱模型的 CL 性能,尽管其预训练能力很强。为减少此类影响,我们提出了一种预比例化机制,以鼓励注意力在所有 token 之间保持多样性。具体做法是首先对注意力进行比例化,聚焦于非汇聚 token,随后进行微调。实验表明,预比例化在无需经验回放或逐步存储先前任务参数的情况下,显著提升了 CL 性能。

关键词

引用

@article{arxiv.2410.05648,
  title  = {Does RoBERTa Perform Better than BERT in Continual Learning: An Attention Sink Perspective},
  author = {Xueying Bai and Yifan Sun and Niranjan Balasubramanian},
  journal= {arXiv preprint arXiv:2410.05648},
  year   = {2024}
}

备注

COLM 2024