一种通用且受进化启发的社交机器人奖励函数
机器人学
2022-02-02 v1 机器学习
摘要
社交机器人领域很可能需摆脱设计行为与模仿学习的范式,并采用现代强化学习(RL)方法,以使机器人能与人类流畅且有效地交互。本文中,我们提出社交奖励函数(Social Reward Function)作为一种机制,以提供(1)在社交机器人中部署RL智能体所必需的实时、稠密奖励函数,以及(2)用于比较不同社交机器人效能的标准化客观度量。社交奖励函数旨在紧密模仿人类那些遗传赋予的社会感知能力,以提供一种简单、稳定且文化无关的奖励函数。目前,社交机器人中使用的数据集要么规模小,要么相对社交机器人任务显著域外。社交奖励函数的使用将允许在接近社交机器人行为策略处收集更大的域内数据集,从而既改进奖励函数,也改进社交机器人的行为策略。我们认为这将是未来开发高效能社交机器人的关键赋能因素。
引用
@article{arxiv.2202.00617,
title = {A General, Evolution-Inspired Reward Function for Social Robotics},
author = {Thomas Kingsford},
journal= {arXiv preprint arXiv:2202.00617},
year = {2022}
}