中文

使用大语言模型对故事类类比进行理解建模

计算与语言 2025-07-16 v1 人工智能

摘要

近期大语言模型(LLMs)的进展使其接近人类在各种任务上的认知水平。这些模型在检测和映射类比方面是否与人类表现一致?先前的研究表明,LLMs 可以从类比问题中提取相似性,但缺乏鲁棒的人类式推理。建立在 Webb、Holyoak 和 Lu(2023)的基础上,本研究聚焦于基于故事的类比映射任务,对 LLM 的推理能力进行细粒度评估,并与人类表现进行比较。首先,我们探索了类比在 LLM 中的语义表示,利用句子嵌入评估它们是否捕捉到类比中 source 与 target 文本之间的相似性,以及 source 与干扰文本之间的不相似性。其次,研究了明确提示 LLM 解释类比的效果。整个过程中,我们检查 LLMs 是否在单个类比水平上表现出与人类类似的性能配置文件,而不仅仅是在整体准确率水平(如先前研究所做的那样)。我们的实验包括评估模型规模(8B vs. 70B 参数)以及性能在如 GPT-4 和 LLaMA3 等最先进模型架构中的变化。该工作推动了我们对 LLMs 类比推理能力的理解,并探讨了其作为人类推理模型的潜力。

关键词

引用

@article{arxiv.2507.10957,
  title  = {Modeling Understanding of Story-Based Analogies Using Large Language Models},
  author = {Kalit Inani and Keshav Kabra and Vijay Marupudi and Sashank Varma},
  journal= {arXiv preprint arXiv:2507.10957},
  year   = {2025}
}

备注

To appear at CogSci 2025