面向智能社交接待机器人的主动交互框架
机器人学
2021-03-25 v2
摘要
主动式人机交互(HRI)使接待机器人能够基于视觉主动问候人员并提供服务,这已被发现可提升可接受度与客户满意度。现有方法要么基于多阶段决策过程,要么基于端到端决策模型。然而,基于规则的方法需要专家精心投入且只能处理极少预定义场景。另一方面,采用端到端模型的现有工作局限于非常通用的问候或少量行为模式(通常少于10种)。为应对这些挑战,我们提出一种新的端到端框架:带视觉令牌用于人机交互的 Transformer(TFVT-HRI)。该框架首先从RGB相机提取相关物体的视觉令牌。为确保对场景的正确理解,随后采用一个 transformer 决策模型处理视觉令牌,并辅以时间与空间信息。它预测各场景中应采取的恰当动作并识别正确目标。我们的数据采集自一栋办公楼的在岗接待机器人,随后由专家标注恰当的主动行为。动作集通过组合语言、表情符号与身体动作包含1000余种多样模式。我们在离线测试集与真实办公楼环境中的在线用户实验上,将我们的模型与其他 SOTA 端到端模型比较以验证该框架。结果表明,该决策模型在动作触发与选择上达到 SOTA 性能,相较以往被动接待策略更具人性化与智能性。
引用
@article{arxiv.2012.04832,
title = {Proactive Interaction Framework for Intelligent Social Receptionist Robots},
author = {Yang Xue and Fan Wang and Hao Tian and Min Zhao and Jiangyong Li and Haiqing Pan and Yueqiang Dong},
journal= {arXiv preprint arXiv:2012.04832},
year = {2021}
}
备注
Accepted to 2021 IEEE International Conference on Robotics and Automation (ICRA)