平行四边形再现:LLM 生成的类比优于人类
计算与语言
2026-03-20 v1 人工智能
摘要
四项词类比 (A:B::C:D) 经典地几何建模为“平行四边形”,但近期研究表明此模型不良好地捕捉人类如何产生类比的方式,简单局部相似性启发式方法往往提供更好的解释 (Peterson 等,2020)。但平行四边形模型是否因其本身是类比关系的差模型,还是因为人类在生成保持关系的类比方面能力不足?我们将人类和大型语言模型 (LLM) 在同一组来自 (Peterson 等,2020) 的类比问题上的完成情况进行比较。我们发现,LLM 生成的类比可靠地被评定为优于人类生成的类比,并且在分布式嵌入空间 (GloVe) 中也更贴近平行四边形结构。关键在于,我们表明相对于人类类比的改进归因于更大的平行四边形对齐度和对可访问词汇的减少,而非对局部相似性敏感性的提升。此外,LLM 优势并非源于 LLM 在所有方面都表现更优,而是源于人类产生一长尾的弱完成:当仅比较两者最常见的响应时,LLM 优势消失。然而,更大的平行四边形对齐度和更低的词频仍能预测哪些 LLM 完成被评定优于人类。总体而言,这些结果表明平行四边形模型并非类比的差模型。相反,人类可能常常未能产生满足此关系约束的完成,而 LLM 则更一致地做到这一点。
引用
@article{arxiv.2603.19066,
title = {Parallelograms Strike Back: LLMs Generate Better Analogies than People},
author = {Qiawen Ella Liu and Raja Marjieh and Jian-Qiao Zhu and Adele E. Goldberg and Thomas L. Griffiths},
journal= {arXiv preprint arXiv:2603.19066},
year = {2026}
}