有限教师监督下的解码需要理解何时信任教师
计算与语言
2024-10-04 v2 人工智能
摘要
如何有效利用小规模大语言模型(LLM)的监督来提升其生成质量?在允许无限制使用 LLM 监督的场景下,已有许多解码算法能够在无需进一步训练的情况下利用监督。然而,在监督有限(即仅能使用少量由 LLM 生成的 token)的场景下,有效策略仍不明确。为此,我们开发了一种算法,有效聚合小规模 LLM 与 LLM 在初始 token 上的预测,以便后续 token 的生成更准确地依赖于仅使用小规模 LLM。关键在于,根据小规模 LLM 的置信度,灵活地选择过度信任或忽略 LLM 的预测。通过在多种模型和数据集上的实验,我们展示,该方法在常规解码策略上 consistently 提供改进。 https://github.com/HJ-Ok/DecLimSup
引用
@article{arxiv.2406.18002,
title = {Decoding with Limited Teacher Supervision Requires Understanding When to Trust the Teacher},
author = {Hyunjong Ok and Jegwang Ryu and Jaeho Lee},
journal= {arXiv preprint arXiv:2406.18002},
year = {2024}
}
备注
17 pages, 7 figures, EMNLP 2024