中文

边缘探测任务能否揭示问答模型中的语言知识?

计算与语言 2022-09-09 v3

摘要

已有许多研究试图理解大型预训练语言模型(LM)中编码了哪些语法知识(例如理解词元词性的能力)。这是通过“边缘探测”(EP)测试实现的:使用仅来自LM编码器的词元表示,通过监督分类任务预测语段的语法属性(是否具有特定词性)。然而,大多数NLP应用会针对特定任务微调这些LM编码器。在此我们提问:若对LM进行微调,其中语言信息的编码是否会如EP测试所衡量的那样发生变化?具体而言,我们关注问答(QA)任务并在多个数据集上开展实验。我们发现,当微调模型表现良好或在模型被迫学习错误相关性的对抗情形下,EP测试结果并未显著改变。基于类似发现,一些近期论文得出结论认为微调不会改变编码器中的语言知识,但未提供解释。我们发现EP模型本身易于利用EP数据集中的伪相关性。当修正该数据集偏差后,我们如预期那样观察到EP测试结果的提升。

关键词

引用

@article{arxiv.2109.07102,
  title  = {Can Edge Probing Tasks Reveal Linguistic Knowledge in QA Models?},
  author = {Sagnik Ray Choudhury and Nikita Bhutani and Isabelle Augenstein},
  journal= {arXiv preprint arXiv:2109.07102},
  year   = {2022}
}

备注

Accepted COLING 2022