中文

AI 会议最佳举办地,温哥华还是______:为何补全比较问句如此困难

计算与语言 2021-04-06 v1

摘要

尽管像BERT这样的大型神经语言模型(LM)经微调后可在许多NLP任务上取得最先进结果,这些模型实际学到了什么往往并不清晰。此处我们研究使用此类LM填补人类撰写的比较问句中的实体,例如“哪个国家更古老,印度还是______?”——即我们研究神经LM提出(而非回答)合理问题的能力。我们表明,该完形填空任务的准确率与人类对问句是否合理判断高度相关,且这些模型可被训练至在三个不同子域的比较问句补全上达到接近人类水平的表现。然而,分析显示它们所学内容未能建模任何关于哪些实体在语义上可比较或相似的宽泛概念——相反,训练后的模型极具领域特异性,且表现与训练集中观测到的特定实体间共现高度相关。无论是对通用文本语料预训练的模型,还是对大型比较问句语料训练的模型,均如此。因此,我们的研究强化了近期关于难以基于特定基准问题表现断言深度模型的世界知识或语言能力的结论。我们公开评估数据集,以促进未来关于此类模型在人类交互标准下的复杂理解与推理研究。

关键词

引用

@article{arxiv.2104.01940,
  title  = {What's the best place for an AI conference, Vancouver or ______: Why completing comparative questions is difficult},
  author = {Avishai Zagoury and Einat Minkov and Idan Szpektor and William W. Cohen},
  journal= {arXiv preprint arXiv:2104.01940},
  year   = {2021}
}

备注

AAAI 2021; preprint