中文

从数据到常识推理:大型语言模型用于可解释人工智能

人工智能 2024-07-08 v1 计算与语言 人机交互

摘要

常识推理是计算机难以完成的任务,但也是人工智能(AI)的关键技能。它可以通过使模型能够为其决策提供直观且类似人的解释来增强AI模型的可解释性。这在许多领域尤为重要,特别是问答(QA),这是自然语言处理(NLP)中最重要的任务之一。随着时间的推移,出现了许多方法来解决常识推理问题,如使用形式逻辑或语言分析的知识库方法。本文我们考察了大型语言模型(LLMs)在不同QA任务上的有效性,重点关注其推理和可解释性能力。我们研究了三个LLMs:GPT-3.5、Gemma 和 Llama 3。我们通过问卷评估了LLM结果。我们展示了LLMs能够进行常识推理,模型在不同数据集上均超越了人类。尽管GPT-3.5的准确率在各种QA基准测试中从56%到93%不等,Llama 3在所有十一个数据集上的平均准确率达到90%。其中,Llama 3在所有数据集上都超越了人类,平均准确率比十个数据集高出21%。此外,我们可以评估到,从可解释人工智能(XAI)的角度来看,GPT-3.5为其决策提供良好的解释。我们的问卷显示,66%的受访者认为GPT-3.5的解释为“良好”或“优秀”。总体而言,这些发现丰富了对当前LLMs的理解,为未来推理和可解释性的研究指明了方向。

关键词

引用

@article{arxiv.2407.03778,
  title  = {From Data to Commonsense Reasoning: The Use of Large Language Models for Explainable AI},
  author = {Stefanie Krause and Frieder Stolzenburg},
  journal= {arXiv preprint arXiv:2407.03778},
  year   = {2024}
}

备注

19 pages