中文

用于减少机器人辅助中偏差的公平性敏感策略梯度强化学习

机器人学 2023-06-08 v1

摘要

机器人在各种活动中辅助人类,从日常生活公共服务(如机场和餐厅)到协同制造。然而,假设机器人从某一人群学到的知识与策略可应用于其他群体是危险的。机器人的歧视性表现将削弱其对部分人的服务质量、忽视其服务请求,甚至冒犯他们。因此,减轻机器人决策中的偏差以实现更公平的服务至关重要。本文中,我们设计了一种自我反思机制——公平性敏感策略梯度强化学习(FSPGRL),以帮助机器人在与人类交互过程中自我识别偏差行为。FSPGRL 通过检查沿特定梯度的异常更新来识别偏差,并更新策略网络以支持机器人的公平决策。为验证 FSPGRL 的有效性,设计了一个以人为中心的服务场景“机器人在餐厅为人们服务”。开展了一项用户研究;24 名人类受试者参与生成了 1,000 条服务演示。从机器人行为中观察到四类常见问题:“意愿问题”、“优先级问题”、“质量问题”、“风险问题”。通过使用 FSPGRL 改进机器人决策,证明机器人具备自我偏差检测能力以实现更公平的服务。我们实现了偏差的抑制,并在机器人学习过程中提升了质量,从而得到一个相对公平的模型。

关键词

引用

@article{arxiv.2306.04167,
  title  = {Fairness-Sensitive Policy-Gradient Reinforcement Learning for Reducing Bias in Robotic Assistance},
  author = {Jie Zhu and Mengsha Hu and Xueyao Liang and Amy Zhang and Ruoming Jin and Rui Liu},
  journal= {arXiv preprint arXiv:2306.04167},
  year   = {2023}
}