ANALOGICAL——一种用于大语言模型长文本类比评估的新基准
计算与语言
2023-05-29 v3 人工智能
摘要
在过去十年中,以词级类比形式的类比,作为评估 word2vec 等词嵌入方法质量的内在度量发挥了重要作用。然而,现代大语言模型(LLMs)主要在基于 GLUE 和 SuperGLUE 等基准的外在度量上接受评估,关于 LLMs 是否能在长文本间进行类比的研究寥寥无几。本文中,我们提出 ANALOGICAL,一个新的基准,用于在包含六个复杂度层级的类比分类体系内对 LLMs 进行内在评估——(i) 词,(ii) 词对句子,(iii) 句法,(iv) 否定,(v) 蕴涵,以及 (vi) 隐喻。利用十三个数据集和三种不同的距离度量,我们评估了八个 LLMs 在语义向量空间中识别类比对的能力。我们的评估发现,随着类比分类层级的提升,LLMs 识别类比变得越来越困难。
引用
@article{arxiv.2305.05050,
title = {ANALOGICAL -- A Novel Benchmark for Long Text Analogy Evaluation in Large Language Models},
author = {Thilini Wijesiriwardene and Ruwan Wickramarachchi and Bimal G. Gajera and Shreeyash Mukul Gowaikar and Chandan Gupta and Aman Chadha and Aishwarya Naresh Reganti and Amit Sheth and Amitava Das},
journal= {arXiv preprint arXiv:2305.05050},
year = {2023}
}
备注
Accepted as a long paper at Findings of ACL 2023