AnaloBench:用于评估抽象和长上下文类比识别能力的基准
计算与语言
2024-10-07 v2 人工智能
摘要
人类定期从事类比思维,将个人经验与当前情境联系起来(X 类比于 Y 因为 Z)。类比思维使人类能够以创造性方式解决问题,把握难以理解的概念,并更有效地表达想法。语言模型 (LMs) 能否做到这一点?为回答此问题,我们提出 AnaloBench,用于确定 LMs 类比推理能力的基准。我们的评估方法聚焦于人类共有的这两个方面:(i) 从大量信息中回想相关经验,和 (ii) 将类比推理应用于复杂且冗长的情境。我们测试了广泛的专有模型(如 GPT 系列,Claude V2)和开源模型如 LLaMA2。与先前结果类似,扩大 LMs 结果会带来一些性能提升。令人惊讶的是,当 (i) 类比涉及冗长情境时,或 (ii) 从大量信息中回想相关情境(相当于寻找针头),规模几乎没有提供显著收益。我们希望这些观察结果鼓励进一步的研究。
引用
@article{arxiv.2402.12370,
title = {AnaloBench: Benchmarking the Identification of Abstract and Long-context Analogies},
author = {Xiao Ye and Andrew Wang and Jacob Choi and Yining Lu and Shreya Sharma and Lingfeng Shen and Vijay Tiyyala and Nicholas Andrews and Daniel Khashabi},
journal= {arXiv preprint arXiv:2402.12370},
year = {2024}
}
备注
Accepted to EMNLP 2024 (Main)