后见之明令语言模型成为更优的指令遵循者
计算与语言
2023-02-13 v1 人工智能
摘要
强化学习在通过人类反馈微调大语言模型以更好地对齐指令方面取得了广泛成功。所谓的基于人类反馈的强化学习(RLHF)算法在 GPT 系列模型上展现出令人印象深刻的性能。然而,底层的强化学习(RL)算法复杂,并且需要额外的奖励网络与价值网络训练流程。在本文中,我们考虑一种替代方法:通过将原始指令重新标注为反馈所对应的指令,并以监督方式训练模型以实现更好的对齐。该算法除原始语言模型外不需要任何额外参数,并最大限度地复用了预训练流程。为此,我们将语言模型的指令对齐问题表述为决策中的目标达成问题。我们提出后见指令重标(HIR),一种用于使语言模型与指令对齐的新算法。由此产生的两阶段算法启发了一系列无奖励方法,其利用基于反馈的后见重标指令。我们在 12 个具有挑战性的 BigBench 推理任务上广泛评估了 HIR 的性能,结果表明 HIR 优于基线算法,并且可与监督微调相媲美甚至超越之。
引用
@article{arxiv.2302.05206,
title = {The Wisdom of Hindsight Makes Language Models Better Instruction Followers},
author = {Tianjun Zhang and Fangchen Liu and Justin Wong and Pieter Abbeel and Joseph E. Gonzalez},
journal= {arXiv preprint arXiv:2302.05206},
year = {2023}
}