SequenceMatch:基于回溯的自回归序列建模模仿学习
机器学习
2024-05-07 v3 人工智能
摘要
在许多领域中,自回归模型在预测下一观测的任务上可获得高似然。然而,该最大似然(MLE)目标未必与自回归生成高质量序列的下游用例相匹配。MLE 目标按序列在数据分布下的频率成比例加权,对分布外(OOD)的模型行为缺乏指导:导致自回归生成过程中的复合误差。为解决该复合误差问题,我们将序列生成表述为模仿学习(IL)问题。这使我们能够最小化自回归模型生成的序列分布与数据集序列之间的多种散度,包括对在 OOD 生成序列上加权的散度。IL 框架还允许我们通过向生成过程引入退格动作来结合回溯。这通过允许模型在将序列带入 OOD 时撤销已采样词元,进一步缓解复合误差问题。我们得到的方法 SequenceMatch 无需对抗训练或架构改动即可实现。我们确定 SequenceMatch- 散度作为用于生成的自治回归模型更合适的训练目标。我们通过实验表明,SequenceMatch 训练在语言模型文本生成与算术上相较 MLE 取得了改进。
引用
@article{arxiv.2306.05426,
title = {SequenceMatch: Imitation Learning for Autoregressive Sequence Modelling with Backtracking},
author = {Chris Cundy and Stefano Ermon},
journal= {arXiv preprint arXiv:2306.05426},
year = {2024}
}
备注
Poster, ICLR 2024