中文

HellaSwag:机器真能补全你的句子吗?

计算与语言 2019-05-21 v1

摘要

Zellers 等人(2018)近期的工作引入了一项常识自然语言推理新任务:给定如“一名女子坐在钢琴前”这样的事件描述,机器必须选择最可能的后续:“她将手指放在琴键上。”随着 BERT 的提出,达到了接近人类水平的性能。这是否意味着机器能进行人类水平的常识推理?本文中,我们通过提出 HellaSwag 这一新挑战数据集,表明常识推理即便对最先进的模型仍属困难。尽管其问题对人类而言微不足道(准确率 >95%),最先进模型却表现挣扎(<48%)。我们通过对抗过滤(Adversarial Filtering, AF)实现这一点,这是一种数据收集范式,其中一系列判别器迭代地筛选出机器生成的错误答案的对抗集合。AF 被证明出奇地鲁棒。关键洞见在于将数据集样例的长度与复杂度扩展到关键的“金发姑娘”区,其中生成的文本对人类而言荒谬可笑,却常被最先进模型误分类。我们对 HellaSwag 的构建及其引发的难度,揭示了深度预训练模型的内在机制。更广泛地,它为 NLP 研究指出了一条新路径,即基准以对抗方式随不断演进的最先进水平共同演化,从而呈现愈发困难的挑战。

关键词

引用

@article{arxiv.1905.07830,
  title  = {HellaSwag: Can a Machine Really Finish Your Sentence?},
  author = {Rowan Zellers and Ari Holtzman and Yonatan Bisk and Ali Farhadi and Yejin Choi},
  journal= {arXiv preprint arXiv:1905.07830},
  year   = {2019}
}

备注

ACL 2019. Project page at https://rowanzellers.com/hellaswag