中文

基于合成数据的大语言模型蒸馏自我批评:贝叶斯视角

计算与语言 2024-04-15 v3 机器学习

摘要

本文通过引入蒸馏自我批评,提出了一种将 RLAIF 解释为贝叶斯推断的方法,该方法通过吉布斯采样器细化 LLM 的输出,随后将其蒸馏到微调模型中。dSC 仅需合成数据,在与安全、情感和隐私控制相关的实验中进行了演练,表明它可以成为对齐 LLM 的一种可行且廉价的替代方案。代码发布于 \url{https://github.com/vicgalle/distilled-self-critique}。

关键词

引用

@article{arxiv.2312.01957,
  title  = {Distilled Self-Critique of LLMs with Synthetic Data: a Bayesian Perspective},
  author = {Victor Gallego},
  journal= {arXiv preprint arXiv:2312.01957},
  year   = {2024}
}

备注

Accepted to ICLR 2024 (TinyPapers track)