中文

LeTI:从文本交互中学习生成

计算与语言 2024-03-20 v2 人工智能 软件工程

摘要

微调预训练语言模型(LMs)对于增强其能力至关重要。现有技术通常在输入输出对(例如指令微调)上微调,或使用衡量输出质量的数值奖励(例如 RLHF)。我们探索 LMs 从文本交互(LETI)中学习的潜力,这些交互不仅用二元标签检查其正确性,还通过文本反馈指出并解释其输出中的错误。我们的关注点是代码生成任务,即模型基于自然语言指令生成代码。这一设定引出了一种自然且可扩展的获取文本反馈的方式:使用 Python 解释器执行代码所产生的错误消息与堆栈跟踪。LETI 使用 LM 目标,在自然语言指令、LM 生成的程序与文本反馈的拼接上迭代微调模型。在此微调文本前,使用一个二元奖励标记来区分正确与有缺陷的解。LETI 训练无需真实输出,甚至优于使用真实输出微调的基线。LETI 不仅提升了 LMs 在代码生成数据集 MBPP 上的表现,还能泛化到其他数据集。在 MBPP 上训练后,其在 HumanEval 中未见问题上取得了与基础 LMs 相当或更好的性能。此外,与二元反馈相比,我们观察到文本反馈带来了更高的生成质量与样本效率,以不到一半的梯度步数达到相同性能。当自然语言任务可表述为代码生成时,LETI 同样适用,我们已在事件论元抽取上进行了实证验证。

关键词

引用

@article{arxiv.2305.10314,
  title  = {LeTI: Learning to Generate from Textual Interactions},
  author = {Xingyao Wang and Hao Peng and Reyhaneh Jabbarvand and Heng Ji},
  journal= {arXiv preprint arXiv:2305.10314},
  year   = {2024}
}

备注

NAACL 2024 Findings