DORB:利用Bandits动态优化多重奖励
计算与语言
2020-11-17 v1 人工智能
机器学习
摘要
基于策略梯度的强化学习已被证明是一种有前景的方法,可直接优化语言生成任务中不可微的评价指标。然而,针对特定指标奖励进行优化主要仅能提升该指标,这表明模型以某种特定方式利用了该指标的形式化定义,而往往未实现真正的定性改进。因此,让模型联合优化多个多样化指标奖励更为有益。尽管有吸引力,但这具有挑战性,因为需要手动决定这些指标奖励的重要性和缩放权重。此外,考虑使用随时间灵活变化的指标奖励的动态组合与课程至关重要。考虑到上述方面,在我们的工作中,我们通过多臂bandit方法(DORB)自动化地同时优化多个指标奖励,其中每轮bandit根据期望臂收益选择下一个要优化的指标奖励。我们使用Exp3算法用于bandit,并形式化了两种bandit奖励方法:(1)单一多重奖励Bandit(SM-Bandit);(2)层次化多重奖励Bandit(HM-Bandit)。我们通过各种自动指标和人工评估在两个重要的自然语言生成(NLG)任务上实证展示了我们方法的有效性:问题生成和数据到文本生成,包括一个未见测试迁移设置。最后,我们对所学bandit课程在优化奖励上的情况给出了可解释的分析。
引用
@article{arxiv.2011.07635,
title = {DORB: Dynamically Optimizing Multiple Rewards with Bandits},
author = {Ramakanth Pasunuru and Han Guo and Mohit Bansal},
journal= {arXiv preprint arXiv:2011.07635},
year = {2020}
}
备注
EMNLP 2020 (15 pages)