中文

辩证式语言模型评估:对 LLM 常识空间推理能力的初步考察

计算与语言 2023-04-25 v1 人工智能

摘要

语言模型近来非常流行,关于其能力(包括常识推理)已有诸多宣称。鉴于当前语言模型在既往静态常识推理基准上取得越来越好的结果,我们探索了一种替代性的辩证式评估。此类评估的目的并非获得聚合性能值,而是发现失败并刻画系统的边界。与系统对话提供了检查一致性并获得超越轶事证据的这些边界的更多确信的机会。本文中,我们针对空间推理(常识推理的基本方面)这一特例,对此类评估进行了若干定性研究。我们以一些建议作结,指向未来工作,以同时提升语言模型能力与使此类辩证式评估系统化。

关键词

引用

@article{arxiv.2304.11164,
  title  = {Dialectical language model evaluation: An initial appraisal of the commonsense spatial reasoning abilities of LLMs},
  author = {Anthony G Cohn and Jose Hernandez-Orallo},
  journal= {arXiv preprint arXiv:2304.11164},
  year   = {2023}
}

备注

11 pages in main paper + 71 pages in appendix