大语言模型是上下文语义推理者而非符号推理者
计算与语言
2023-06-09 v2 人工智能
摘要
大语言模型(LLMs)涌现的少样本推理能力近年来令自然语言与机器学习界振奋。尽管有众多成功应用,此类上下文能力的底层机制仍不清楚。本文中,我们假设语言令牌所学得的语义在推理过程中承担了最主要的重任。不同于人类的符号推理过程,LLMs的语义表征可在令牌间建立强连接,从而组合出表观逻辑链。为检验我们的假设,我们将语义从语言推理过程中解耦,并评估三类推理能力,即演绎、归纳与溯因。我们的发现揭示语义在LLMs的上下文推理中扮演关键角色——当语义与常识一致时LLMs表现显著更好,而难以通过利用上下文新知识解决符号或反常识推理任务。这些令人惊讶的观察质疑现代LLMs是否已如人类智能般掌握了归纳、演绎与溯因推理能力,并推动揭示黑盒LLMs中现存魔力的研究。总体而言,我们的分析为语义在发展与评估语言模型推理能力中的作用提供了新视角。代码可见于{\url{https://github.com/XiaojuanTang/ICSR}}。
引用
@article{arxiv.2305.14825,
title = {Large Language Models are In-Context Semantic Reasoners rather than Symbolic Reasoners},
author = {Xiaojuan Tang and Zilong Zheng and Jiaqi Li and Fanxu Meng and Song-Chun Zhu and Yitao Liang and Muhan Zhang},
journal= {arXiv preprint arXiv:2305.14825},
year = {2023}
}