中文

离线强化学习能否助力自然语言理解?

计算与语言 2022-12-09 v1

摘要

预训练是一种学习隐式可迁移知识的有用方法,并且它展示了在不同模态间提供互补特征的好处。近期工作主要关注图像与文本等模态,例如研究表明从图像中学习到的视觉特征有助于视觉接地语言理解。本文中,我们考虑探究离线强化学习(RL)与语言建模(LM)之间的潜在联系。直观上,RL 与 LM 相似,都基于当前与先前状态预测下一状态,这依赖于状态间局部与长程的依赖关系。为验证该假设,我们使用 Transformer 预训练不同的离线 RL 任务,随后在各种语言相关任务上评估这些模型。实验结果表明,我们的 RL 预训练模型能够取得与使用 LM 训练目标的模型相近的性能,表明这两种模态间存在共用的有用特征。为进一步探索潜在关系,我们考察了马尔可夫性质与 RL 轨迹的序列特性等因素。

关键词

引用

@article{arxiv.2212.03864,
  title  = {Can Offline Reinforcement Learning Help Natural Language Understanding?},
  author = {Ziqi Zhang and Yile Wang and Yue Zhang and Donglin Wang},
  journal= {arXiv preprint arXiv:2212.03864},
  year   = {2022}
}

备注

8 pages,3 figures,4 tables