中文

RICA:基于常识公理的鲁棒推理能力评测

计算与语言 2021-09-13 v4 人工智能 计算机科学中的逻辑

摘要

预训练语言模型(PTLM)在常识推理基准上取得了令人印象深刻的性能,但它们运用常识进行鲁棒推理的能力(这对于与人类的有效沟通至关重要)仍存在争议。为推动流畅的人机交流,我们提出了一项新挑战 RICA:基于常识公理的鲁棒推理能力(Robust Inference capability based on Commonsense Axioms),用于评测在文本扰动下的鲁棒常识推理。为生成该挑战的数据,我们开发了一种利用常识知识库的系统且可扩展的流程,并在两种不同评测设定下探查 PTLM。我们在生成的包含逾 1 万条语句的探查集上进行的广泛实验表明,PTLM 在零样本设定下表现不优于随机猜测,深受统计偏差影响,且对扰动攻击不具鲁棒性。我们还发现,在相似语句上微调带来的提升有限,因为 PTLM 仍无法泛化到未见过的推理。我们新提出的大规模基准揭示了 PTLM 与人类水平语言理解之间的显著差距,并为 PTLM 展现常识提出了新挑战。

关键词

引用

@article{arxiv.2005.00782,
  title  = {RICA: Evaluating Robust Inference Capabilities Based on Commonsense Axioms},
  author = {Pei Zhou and Rahul Khanna and Seyeon Lee and Bill Yuchen Lin and Daniel Ho and Jay Pujara and Xiang Ren},
  journal= {arXiv preprint arXiv:2005.00782},
  year   = {2021}
}

备注

Accepted in EMNLP 2021 main conference. 20 pages, 8 figures