探索知识错位假设:小模型在大模型数据上微调时的幻觉倾向
计算与语言
2024-11-05 v1 人工智能
摘要
最近,大型语言模型通过在大型模型生成的数据上进行微调而迎来了激增。这些小模型能够产生看似质量相当的输出。然而,这些模型的一个关键局限性是其倾向于比大型模型更频繁地产生幻觉。特别是,他们被观察到会生成涉及事实错误信息的连贯输出,从而传播虚假信息、有害内容和偏见。存在许多导致幻觉的可能原因,其中一种假设是:在来自大型模型的数据上对模型进行微调会导致知识错位,从而促成幻觉。特别是,假设是微调模型所使用的知识与模型图中已存在的知识之间存在错位。对模型进行此类数据微调可能增加其产生幻觉的倾向。我们在未见的测试集上表明,小模型在来自大型模型生成的数据上进行微调的模型比在小模型创建的数据上进行微调的模型产生错误答案的更多,这一结果确认了该假设。
引用
@article{arxiv.2411.00878,
title = {Exploring the Knowledge Mismatch Hypothesis: Hallucination Propensity in Small Models Fine-tuned on Data from Larger Models},
author = {Phil Wee and Riyadh Baghdadi},
journal= {arXiv preprint arXiv:2411.00878},
year = {2024}
}
备注
6 pages, 3 figures