条件文本生成中的奖励博弈
计算与语言
2023-06-02 v3 人工智能
机器学习
摘要
为使条件文本生成模型输出与期望行为对齐,越来越多地聚焦于使用从人类标注学习的奖励函数,通过强化学习(RL)训练模型。在此框架下,我们识别出三种常见情况,其中高奖励被错误地赋予不良模式:噪声引起的伪相关、自然发生的伪相关以及协变量偏移。我们表明,尽管学习到的度量在用于训练奖励函数的数据分布上取得高性能,但在文本生成模型的 RL 训练期间,不良模式可能被放大。尽管 RL 或安全社区已对奖励博弈有所讨论,在本讨论文章中,我们愿以具体的条件文本生成示例凸显自然语言生成(NLG)社区中的奖励博弈,并探讨潜在的修复方法与未来工作方向。
引用
@article{arxiv.2211.08714,
title = {Reward Gaming in Conditional Text Generation},
author = {Richard Yuanzhe Pang and Vishakh Padmakumar and Thibault Sellam and Ankur P. Parikh and He He},
journal= {arXiv preprint arXiv:2211.08714},
year = {2023}
}
备注
ACL 2023