中文

回到起点:Winograd 模式中的伪迹检测、训练与常识解耦

计算与语言 2021-10-14 v2

摘要

Winograd 模式(WS)被提出作为衡量模型常识能力的测试。近来,基于预训练语言模型的方法在一些 WS 基准上提升了性能,但改进来源仍不清楚。本文认为,WS 上表面上的进展未必反映常识推理的进展。为支持该主张,我们首先表明当前的 WS 评估方法并非最优,并提出一种使用孪生句进行评估的改进方案。我们还提出两个新基线,表明 WS 基准中存在伪迹。随后我们开发一种在零样本设定下评估类 WS 句子的方法,以考量预训练期间获得的常识推理能力,并观察到当使用我们更严格的评估时,流行的语言模型在该设定下表现随机。我们得出结论:观察到的进展主要源于在训练 WS 模型时使用了监督,而这不太可能成功支撑所有必需的常识推理技能与知识。

关键词

引用

@article{arxiv.2104.08161,
  title  = {Back to Square One: Artifact Detection, Training and Commonsense Disentanglement in the Winograd Schema},
  author = {Yanai Elazar and Hongming Zhang and Yoav Goldberg and Dan Roth},
  journal= {arXiv preprint arXiv:2104.08161},
  year   = {2021}
}

备注

Accepted to EMNLP 2021