反转诅咒:在“A是B”上训练的LLM无法学会“B是A”
计算与语言
2024-05-28 v4 人工智能
机器学习
摘要
我们揭示了自回归大语言模型(LLM)中一个令人惊讶的泛化失败现象。如果一个模型在形如“A是B”的句子上训练,它不会自动泛化到反方向“B是A”。这就是反转诅咒。例如,如果一个模型在“Valentina Tereshkova是首位进入太空的女性”上训练,它不会自动回答出问题“谁是首位进入太空的女性?”。此外,正确答案(“Valentina Tershkova”)的似然不会高于一个随机名字。因此,模型并未泛化其训练集中的一种普遍模式:若“A是B”出现,则“B是A”更可能出现。不过值得注意的是,如果“A是B”出现在上下文中,模型可以推导出反向关系。我们通过将GPT-3和Llama-1在虚构陈述(如“Uriah Hawthorne是Abyssal Melodies的作曲家”)上微调,并展示它们无法正确回答“谁创作了Abyssal Melodies?”来提供反转诅咒的证据。反转诅咒在不同模型规模和模型族中均稳健存在,且无法通过数据增强缓解。我们还在关于真实世界名人的问题上评估了ChatGPT(GPT-3.5和GPT-4),例如“Tom Cruise的母亲是谁?[答:Mary Lee Pfeiffer]”及其反向“Mary Lee Pfeiffer的儿子是谁?”。GPT-4正确回答前一类问题的比例为79%,而后一类仅为33%。代码见:https://github.com/lukasberglund/reversal_curse。
引用
@article{arxiv.2309.12288,
title = {The Reversal Curse: LLMs trained on "A is B" fail to learn "B is A"},
author = {Lukas Berglund and Meg Tong and Max Kaufmann and Mikita Balesni and Asa Cooper Stickland and Tomasz Korbak and Owain Evans},
journal= {arXiv preprint arXiv:2309.12288},
year = {2024}
}
备注
21 pages, 11 figures