面向强化学习的情感分析
计算与语言
2020-10-07 v1
摘要
尽管强化学习(RL)在对话生成和基于文本的游戏等自然语言处理(NLP)领域取得了成功,但它通常面临稀疏奖励问题,导致收敛缓慢或无法收敛。传统方法仅利用文本描述提取状态表示,忽略了其中固有的反馈。例如,在基于文本的游戏里,“干得好!你吃了食物”这类描述表示进展,“你进入了一个新房间”这类描述表示探索。诸如此类的正面与负面线索可通过情感分析转化为奖励。该技术将稀疏奖励问题转化为稠密奖励问题,从而更易求解。此外,这可以实现无奖励的强化学习,即智能体完全从这些内在情感奖励中学习。该框架类似于内在动机,环境未必提供奖励,而是智能体自行分析并意识到奖励。我们发现,在基于文本的游戏中使用情感分析提供稠密奖励在某些条件下可提升性能。
引用
@article{arxiv.2010.02316,
title = {Sentiment Analysis for Reinforcement Learning},
author = {Ameet Deshpande and Eve Fleisig},
journal= {arXiv preprint arXiv:2010.02316},
year = {2020}
}
备注
Work in progress