探索 BERT 与基于 GPT 的大语言模型中的反转诅咒及其他演绎逻辑推理
计算与语言
2024-07-03 v3 人工智能
机器学习
摘要
"反转诅咒"(Reversal Curse)一词是指如下场景:自回归解码器大语言模型(LLM),如 ChatGPT,在以"A is B"进行训练后无法学到"B is A",这里假设 B 和 A 是不同的且能彼此唯一识别,这表明了逻辑演绎的基本失效。考虑到 GPT 模型对该对称原则的遵循,这为在某些通用任务(如构建知识图谱)中使用 GPT 模型敲响了警钟。在我们的研究中,我们考察了双向 LLM BERT,发现它对反转诅咒免疫。受利用 LLM 构建生物医学知识图谱的持续努力所驱动,我们还着手评估更复杂但必不可少的演绎推理能力。该过程首先训练编码器和解码器语言模型以掌握两个集合的交集和并集运算,然后评估它们推断三个新建集合上并集与交集不同组合运算的能力。结果表明,虽然针对涉及两个集合(并集/交集)任务训练的编码器和解码器语言模型在此类场景中表现熟练,但在处理包含三个集合(并集与交集的各种组合)的运算时遇到了困难。我们的研究突出了编码器和解码器模型在简单和复杂逻辑推理中的不同特性。在实践中,在 BERT 和 GPT 之间的选择应以当前任务的具体要求和性质为指导,发挥它们在双向上下文理解和序列预测方面各自的优势。
引用
@article{arxiv.2312.03633,
title = {Exploring the Reversal Curse and Other Deductive Logical Reasoning in BERT and GPT-Based Large Language Models},
author = {Da Wu and Jingye Yang and Kai Wang},
journal= {arXiv preprint arXiv:2312.03633},
year = {2024}
}
备注
Final revision. To appear in Patterns