GRATH:大语言模型的渐进自我真实化
计算与语言
2024-02-01 v2 人工智能
摘要
真实性对于大语言模型(LLMs)至关重要,因为它们越来越多地部署在现实世界的应用中。然而,现有的LLMs在生成真实内容方面仍然存在困难,这从它们在TruthfulQA等基准测试中的中等表现可以看出。为了解决这个问题,我们提出了渐进自我真实化(GRATH),一种新颖的后处理方法,用于增强LLMs的真实性。GRATH利用域外问题提示生成成对的真实性训练数据,每对包含一个问题及其正确和错误答案,然后通过直接偏好优化(DPO)优化模型,以学习答案对之间的真实性差异。GRATH迭代地精炼真实性数据并更新模型,从而以自监督的方式逐步提高模型的真实性。在实证中,我们使用不同的7B-LLMs评估GRATH,并与基准数据集上相似甚至更大规模的LLMs进行比较。我们的结果表明,GRATH在不损害其他核心能力的情况下有效提高了LLMs的真实性。值得注意的是,GRATH在TruthfulQA上达到了最先进的性能,MC1准确率为54.71%,MC2准确率为69.10%,甚至超过了70B-LLMs的表现。
引用
@article{arxiv.2401.12292,
title = {GRATH: Gradual Self-Truthifying for Large Language Models},
author = {Weixin Chen and Dawn Song and Bo Li},
journal= {arXiv preprint arXiv:2401.12292},
year = {2024}
}