共现对大语言模型事实知识的影响
计算与语言
2023-10-13 v1 人工智能
机器学习
摘要
尽管大语言模型(LLMs)在各种应用中取得成功,它们常给出事实错误的回答。本文假设,严重依赖预训练语料的简单共现统计是导致事实错误的主要因素之一。我们的结果表明,LLMs 易受共现偏差影响,即偏好频繁共现的词而非正确答案。因此,即便在微调阶段见过,LLMs 仍难以回忆起主语与宾语在预训练数据集中极少共现的事实。我们展示共现偏差在扩大模型规模或微调后依然存在。因此,我们建议通过在去偏数据集上微调来缓解该偏差,即过滤掉主宾共现计数高的有偏样本。尽管去偏微调使 LLMs 能记忆训练集中的罕见事实,其对回忆微调阶段未见的罕见事实并无效果。进一步的缓解研究将有助于通过防范潜在错误来构建可靠的语言模型。代码见 \url{https://github.com/CheongWoong/impact_of_cooccurrence}。
引用
@article{arxiv.2310.08256,
title = {Impact of Co-occurrence on Factual Knowledge of Large Language Models},
author = {Cheongwoong Kang and Jaesik Choi},
journal= {arXiv preprint arXiv:2310.08256},
year = {2023}
}
备注
EMNLP 2023 Findings