中文

面向咨询师反思生成的多奖励强化学习中的动态奖励调整

计算与语言 2024-03-21 v1 机器学习

摘要

本文研究多奖励强化学习问题,旨在联合优化自然语言生成的多种文本质量。我们聚焦于咨询师反思生成任务,优化生成器以同时提升所生成咨询师回应的流畅性、连贯性和反思质量。我们引入两种新颖的赌博机方法 DynaOpt 和 C-DynaOpt,它们依赖于将多个奖励组合为单一值并同时优化的广泛策略。具体而言,我们采用非上下文和上下文多臂赌博机在训练过程中动态调整多个奖励的权重。通过自动评估和人工评估,我们表明所提出的技术 DynaOpt 和 C-DynaOpt 优于现有的朴素基线和赌博机基线,展示了它们增强语言模型的潜力。

关键词

引用

@article{arxiv.2403.13578,
  title  = {Dynamic Reward Adjustment in Multi-Reward Reinforcement Learning for Counselor Reflection Generation},
  author = {Do June Min and Veronica Perez-Rosas and Kenneth Resnicow and Rada Mihalcea},
  journal= {arXiv preprint arXiv:2403.13578},
  year   = {2024}
}