中文

通过因果推断从预训练语言模型中保留常识知识

计算与语言 2023-06-21 v1 人工智能

摘要

微调已被证明是一种简单有效的技术,可将预训练语言模型(PLMs)学到的知识迁移到下游任务。然而,原始微调容易过拟合目标数据并降低泛化能力。大多数现有研究将其归因于灾难性遗忘,且不加区分地保留预训练知识,而未识别哪些知识是可迁移的。受此启发,我们将微调构建为一个因果图,并发现灾难性遗忘的关键在于缺失来自预训练数据的因果效应。基于该因果视角,我们提出了一个统一的微调目标以恢复因果性。有趣的是,该统一目标可视为原始微调目标(从目标数据学习新知识)与因果目标(从 PLM 保留旧知识)之和。因此,我们的方法灵活,能在保留知识的同时缓解负迁移。由于赋予模型常识是一项长期挑战,我们在常识问答(QA)上以提出的启发式估计实现本方法以验证其有效性。实验中,我们的方法在所有六个常识 QA 数据集上均优于最先进的微调方法,并且可作为插件模块提升现有 QA 模型的性能。

关键词

引用

@article{arxiv.2306.10790,
  title  = {Preserving Commonsense Knowledge from Pre-trained Language Models via Causal Inference},
  author = {Junhao Zheng and Qianli Ma and Shengjie Qiu and Yue Wu and Peitian Ma and Junlong Liu and Huawen Feng and Xichen Shang and Haibin Chen},
  journal= {arXiv preprint arXiv:2306.10790},
  year   = {2023}
}

备注

ACL 2023 (oral paper)