跨时间探测:RoBERTa 知道什么以及何时知道?
计算与语言
2021-09-21 v2
摘要
在极大型语料上训练的语言模型已被证明对 NLP 有用。作为固定产物,它们已成为深入研究的对象,许多研究者“探测”其所习得并容易展现的语言抽象、事实与常识知识以及推理能力的程度。基于这一工作脉络,我们考虑一个新问题:对于语言模型习得的各类知识,它们在(预)训练期间的何时被获取?我们以 RoBERTa 为案例,绘制了跨迭代次数的探测性能曲线。我们的发现包括:语言知识被快速、稳定且跨领域鲁棒地获取;事实与常识更慢且对领域更敏感;推理能力总体上未被稳定获取。随着新数据集、预训练协议和探测方法的出现,我们相信跨时间探测分析可帮助研究者理解这些模型所经历的复杂、交织的学习,并引导我们走向更高效地更快完成必要学习的方法。
引用
@article{arxiv.2104.07885,
title = {Probing Across Time: What Does RoBERTa Know and When?},
author = {Leo Z. Liu and Yizhong Wang and Jungo Kasai and Hannaneh Hajishirzi and Noah A. Smith},
journal= {arXiv preprint arXiv:2104.07885},
year = {2021}
}
备注
Accepted to EMNLP2021 Finding