中文

一种基于理论依据的机器常识评估基准

计算与语言 2022-07-18 v2

摘要

赋予机器常识推理(CSR)能力是人工智能领域的长期挑战。当前的 CSR 基准使用多选(以及相对较少情况下的生成式)问答实例来评估机器常识。基于 Transformer 的语言表示模型近期取得的进展表明,在现有基准上已取得了可观的进步。然而,尽管目前已有数十个 CSR 基准且仍在增长,尚不清楚常识能力的全部范畴是否得到了系统评估。此外,人们怀疑语言模型是否通过在基准数据集的训练划分上捕捉细微但(至少对 CSR 而言)与规范无关的统计特征来“拟合”该划分,从而在测试划分上取得良好表现。为应对这些挑战,我们提出一个名为基于理论依据的常识推理(TG-CSR)的基准,其同样基于判别式问答,但问题旨在评估常识的多个方面,如空间、时间和世界状态。TG-CSR 基于 Gordon 和 Hobbs 最早提出作为常识可行理论的一个常识类别子集。该基准还被设计为少样本(未来为零样本),仅提供少量训练与验证样例。本报告讨论了该基准的结构与构建。初步结果表明,即便对于为判别式 CSR 问答任务设计的先进语言表示模型,该基准也具有挑战性。基准访问与排行榜:https://codalab.lisn.upsaclay.fr/competitions/3080 基准网站:https://usc-isi-i2.github.io/TGCSR/

关键词

引用

@article{arxiv.2203.12184,
  title  = {A Theoretically Grounded Benchmark for Evaluating Machine Commonsense},
  author = {Henrique Santos and Ke Shen and Alice M. Mulvehill and Yasaman Razeghi and Deborah L. McGuinness and Mayank Kejriwal},
  journal= {arXiv preprint arXiv:2203.12184},
  year   = {2022}
}