中文

跨时间探测:RoBERTa 知道什么以及何时知道?

计算与语言 2021-09-21 v2

摘要

在极大型语料上训练的语言模型已被证明对 NLP 有用。作为固定产物,它们已成为深入研究的对象,许多研究者“探测”其所习得并容易展现的语言抽象、事实与常识知识以及推理能力的程度。基于这一工作脉络,我们考虑一个新问题:对于语言模型习得的各类知识,它们在(预)训练期间的何时被获取?我们以 RoBERTa 为案例,绘制了跨迭代次数的探测性能曲线。我们的发现包括:语言知识被快速、稳定且跨领域鲁棒地获取;事实与常识更慢且对领域更敏感;推理能力总体上未被稳定获取。随着新数据集、预训练协议和探测方法的出现,我们相信跨时间探测分析可帮助研究者理解这些模型所经历的复杂、交织的学习,并引导我们走向更高效地更快完成必要学习的方法。

关键词

引用

@article{arxiv.2104.07885,
  title  = {Probing Across Time: What Does RoBERTa Know and When?},
  author = {Leo Z. Liu and Yizhong Wang and Jungo Kasai and Hannaneh Hajishirzi and Noah A. Smith},
  journal= {arXiv preprint arXiv:2104.07885},
  year   = {2021}
}

备注

Accepted to EMNLP2021 Finding