GROOT:面向生成式序列标注的修正奖励优化
计算与语言
2022-12-22 v2
摘要
序列标注是一项基础的自然语言处理(NLP)任务,构成诸多应用的骨干。Seq2Seq 模型的监督学习在这些问题上已展现巨大成功。然而,训练目标仍与我们实际关心的指标和期望显著脱节。例如,一个实际的序列标注应用可能希望优化某种精确率-召回率权衡(针对 top-k 预测),这与最大化金标准标注序列似然的标准目标颇为不同。为弥合此差距,我们提出 GROOT——一个简单而有效的生成式文本序列奖励优化框架。GROOT 通过训练生成式序列标注模型使解码器输出分布与(黑盒)奖励函数分布相匹配来工作。利用迭代训练机制,我们首先生成预测候选,随后纠正其中的错误,最后基于奖励值对比这些候选。如四个公开基准上的广泛实验所示,GROOT 显著改善了所有奖励指标。此外,由 top- 候选的质量提升可见,GROOT 亦改进了解码器整体分布。
引用
@article{arxiv.2209.14694,
title = {GROOT: Corrective Reward Optimization for Generative Sequential Labeling},
author = {Kazuma Hashimoto and Karthik Raman},
journal= {arXiv preprint arXiv:2209.14694},
year = {2022}
}