中文

面向Pepper机器人的低延迟、LLM驱动的多模态交互框架

人工智能 2026-03-24 v1 机器学习 机器人学

摘要

尽管近期在将大语言模型(LLM)集成到社交机器人方面取得了进展,但仍存在两大局限:其一,面向Pepper等平台的现有实现常依赖级联式的语音识别(STT)->LLM->语音合成(TTS)管道,导致高延迟并丢失语音的语义信息;其二,大多数实现未充分发挥LLM在多模态感知和代理控制方面的能力。我们提出一种面向Pepper机器人的开源Android框架,通过两项关键创新来解决上述局限:其一,集成端到端语音到语音(S2S)模型,以实现低延迟交互,同时保留语音语义信息并支持自适应语调;其二,实现广泛的函数调用能力,将LLM提升为代理式规划器,协调机器人动作(导航、注视控制、平板交互),并整合多模态反馈(视觉、触觉、系统状态)。该框架运行在机器人的平板上,也可构建到常规Android智能手机或平板上,以开发从硬件中解耦。本工作为人机交互社区提供了一个实用且可扩展的平台,用于探索先进LLM驱动的具身交互。

关键词

引用

@article{arxiv.2603.21013,
  title  = {A Framework for Low-Latency, LLM-driven Multimodal Interaction on the Pepper Robot},
  author = {Erich Studerus and Vivienne Jia Zhong and Stephan Vonschallen},
  journal= {arXiv preprint arXiv:2603.21013},
  year   = {2026}
}

备注

4 pages, 2 figures. To appear in Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction (HRI '26), Edinburgh, Scotland, March 2026