中文

有限教师监督下的解码需要理解何时信任教师

计算与语言 2024-10-04 v2 人工智能

摘要

如何有效利用小规模大语言模型(LLM)的监督来提升其生成质量?在允许无限制使用 LLM 监督的场景下,已有许多解码算法能够在无需进一步训练的情况下利用监督。然而,在监督有限(即仅能使用少量由 LLM 生成的 token)的场景下,有效策略仍不明确。为此,我们开发了一种算法,有效聚合小规模 LLM 与 LLM 在初始 token 上的预测,以便后续 token 的生成更准确地依赖于仅使用小规模 LLM。关键在于,根据小规模 LLM 的置信度,灵活地选择过度信任或忽略 LLM 的预测。通过在多种模型和数据集上的实验,我们展示,该方法在常规解码策略上 consistently 提供改进。\small Code:\textbf{Code:} https://github.com/HJ-Ok/DecLimSup

关键词

引用

@article{arxiv.2406.18002,
  title  = {Decoding with Limited Teacher Supervision Requires Understanding When to Trust the Teacher},
  author = {Hyunjong Ok and Jegwang Ryu and Jaeho Lee},
  journal= {arXiv preprint arXiv:2406.18002},
  year   = {2024}
}

备注

17 pages, 7 figures, EMNLP 2024