中文

LaMI:面向多模态人机交互的大语言模型

机器人学 2024-04-12 v4 人机交互

摘要

本文提出了一种基于大语言模型(LLM)的创新机器人系统,旨在增强多模态人机交互(HRI)。传统 HRI 系统依赖于复杂的意图估计、推理和行为生成设计,耗费大量资源。相比之下,我们的系统使研究人员和从业者能够通过三个关键方面来调节机器人行为:提供高级语言指导,创建机器人可用的“原子动作”与表情,以及提供一组示例。该系统在物理机器人上实现,展现出适应多模态输入并按照研究人员定义的准则确定适当动作方式以协助人类的能力。同时,它将机器人的眼睑、颈部和耳朵运动与语音输出相协调,以产生动态的多模态表情。这展示了该系统通过从传统的手动状态与流程设计方法转变为直观的、基于指导和示例驱动的方法,从而彻底改变 HRI 的潜力。补充材料可在 https://hri-eu.github.io/Lami/ 获取。

关键词

引用

@article{arxiv.2401.15174,
  title  = {LaMI: Large Language Models for Multi-Modal Human-Robot Interaction},
  author = {Chao Wang and Stephan Hasler and Daniel Tanneberg and Felix Ocker and Frank Joublin and Antonello Ceravola and Joerg Deigmoeller and Michael Gienger},
  journal= {arXiv preprint arXiv:2401.15174},
  year   = {2024}
}

备注

10 pages, 6 figures