中文

ANALOGICAL——一种用于大语言模型长文本类比评估的新基准

计算与语言 2023-05-29 v3 人工智能

摘要

在过去十年中,以词级类比形式的类比,作为评估 word2vec 等词嵌入方法质量的内在度量发挥了重要作用。然而,现代大语言模型(LLMs)主要在基于 GLUE 和 SuperGLUE 等基准的外在度量上接受评估,关于 LLMs 是否能在长文本间进行类比的研究寥寥无几。本文中,我们提出 ANALOGICAL,一个新的基准,用于在包含六个复杂度层级的类比分类体系内对 LLMs 进行内在评估——(i) 词,(ii) 词对句子,(iii) 句法,(iv) 否定,(v) 蕴涵,以及 (vi) 隐喻。利用十三个数据集和三种不同的距离度量,我们评估了八个 LLMs 在语义向量空间中识别类比对的能力。我们的评估发现,随着类比分类层级的提升,LLMs 识别类比变得越来越困难。

关键词

引用

@article{arxiv.2305.05050,
  title  = {ANALOGICAL -- A Novel Benchmark for Long Text Analogy Evaluation in Large Language Models},
  author = {Thilini Wijesiriwardene and Ruwan Wickramarachchi and Bimal G. Gajera and Shreeyash Mukul Gowaikar and Chandan Gupta and Aman Chadha and Aishwarya Naresh Reganti and Amit Sheth and Amitava Das},
  journal= {arXiv preprint arXiv:2305.05050},
  year   = {2023}
}

备注

Accepted as a long paper at Findings of ACL 2023