利用事后上下文加速 bandit 设置中的学习及其在机器人辅助喂食中的应用
机器人学
2021-03-29 v2 人工智能
机器学习
摘要
自主机器人辅助喂食需要具备获取多种食物物品的能力。然而,此类系统不可能针对所有现存食物类型进行训练。因此,一个关键挑战是为先前未见的食物物品选择操控策略。先前工作表明该问题可表示为带视觉上下文的线性 bandit。然而,食物具有多种多样与操控相关的多模态属性,这些属性在视觉上可能难以区分。我们的核心见解是,我们可以利用在操控期间及之后(即“事后”)收集的接触上下文来学习其中部分属性,并更快速地将视觉模型适配到先前未见的食物。一般而言,我们提出一种改进的线性上下文 bandit 框架,其增强了动作选择后观察到的事后上下文,以经验性地提升学习速度并减少累积后悔。在合成数据上的实验表明,当上下文维度相对于事后上下文较大,或当事后上下文模型特别易于学习时,该效应更为显著。最后,我们将此框架应用于咬合获取问题,并在 64 次尝试中以少 21% 的失败率演示了对 8 种先前未见食物类型的获取。
引用
@article{arxiv.2011.02604,
title = {Leveraging Post Hoc Context for Faster Learning in Bandit Settings with Applications in Robot-Assisted Feeding},
author = {Ethan K. Gordon and Sumegh Roychowdhury and Tapomayukh Bhattacharjee and Kevin Jamieson and Siddhartha S. Srinivasa},
journal= {arXiv preprint arXiv:2011.02604},
year = {2021}
}
备注
6 pages + references, 5 figures, to appear in ICRA 2021