基于合成数据的大语言模型蒸馏自我批评:贝叶斯视角
计算与语言
2024-04-15 v3 机器学习
摘要
本文通过引入蒸馏自我批评,提出了一种将 RLAIF 解释为贝叶斯推断的方法,该方法通过吉布斯采样器细化 LLM 的输出,随后将其蒸馏到微调模型中。dSC 仅需合成数据,在与安全、情感和隐私控制相关的实验中进行了演练,表明它可以成为对齐 LLM 的一种可行且廉价的替代方案。代码发布于 \url{https://github.com/vicgalle/distilled-self-critique}。
引用
@article{arxiv.2312.01957,
title = {Distilled Self-Critique of LLMs with Synthetic Data: a Bayesian Perspective},
author = {Victor Gallego},
journal= {arXiv preprint arXiv:2312.01957},
year = {2024}
}
备注
Accepted to ICLR 2024 (TinyPapers track)