中文

语言模型的智能分析

人工智能 2024-07-30 v1

摘要

在本项目中,我们测试了大型语言模型(LLM)在抽象推理语料库(Abstraction and Reasoning Corpus, ARC)数据集上的有效性。该数据集作为测试抽象推理能力的代表性基准,要求对关键概念,如对象识别、基本计数和初等几何原理进行基本理解。我们将来自该数据集的任务转换为用于评估的提示格式。最初,我们通过零样本方法评估模型的潜力。随后,我们检讨 Chain-of-Thought(CoT)技术的应用,以确定其在提高模型性能方面的作用。我们的结果表明,尽管当今大型语言模型备受期待,但这些模型在非语言领域仍然表现不佳,即使在 ARC 数据集的较简单子集上亦如此。我们的研究是首次聚焦于开源模型在此上下文中的能力。支持本项目发现的代码、数据集和提示可在我们的 GitHub 仓库中找到,地址为:https://github.com/Lianga2000/LLMsOnARC。

关键词

引用

@article{arxiv.2407.18968,
  title  = {Intelligence Analysis of Language Models},
  author = {Liane Galanti and Ethan Baron},
  journal= {arXiv preprint arXiv:2407.18968},
  year   = {2024}
}