中文

基于深度 Q 网络的话语驱动反馈信号生成以增强人机交互参与度

人工智能 2019-08-06 v1 机器学习 机器人学

摘要

我们提出一种训练社交机器人在人机交互过程中生成反馈信号(backchannel)的新方法。我们在离策略强化学习框架下处理该问题,并展示机器人如何被训练以产生诸如笑声之类的非言语反馈信号,当训练目标是最大化用户的参与度和注意力时。本工作的主要贡献是将该问题表述为马尔可夫决策过程(MDP),其状态由用户的言语活动定义,奖励由量化的参与水平生成。我们所处理的问题属于这样一类应用:与环境(我们的环境为人)的无限交互是不可能的,因为若执行糟糕策略,可能耗时、昂贵、不可行甚至危险。因此,我们在批量强化学习框架中引入深度 Q 网络(DQN),其中最优策略从由较受控策略收集的批量数据中学习。我们建议使用人与人二元交互数据集作为批量轨迹来训练用于引人入胜交互的智能体。我们的实验展示了以离线方式训练机器人产生引人入胜行为的潜力。

关键词

引用

@article{arxiv.1908.01618,
  title  = {Speech Driven Backchannel Generation using Deep Q-Network for Enhancing Engagement in Human-Robot Interaction},
  author = {Nusrah Hussain and Engin Erzin and T. Metin Sezgin and Yucel Yemez},
  journal= {arXiv preprint arXiv:1908.01618},
  year   = {2019}
}

备注

8 pages, 2 figures, 3 tables