跨语音、情感与动作的多模态边缘可部署框架:基于视觉语言模型的人形机器人
机器人学
2026-02-10 v1 人工智能
摘要
有效的人机交互需要情感丰富的多模态表达,但大多数人形机器人缺乏协调的语音、面部表情和手势。同时,实际部署要求在设备端运行的解决方案能够在无需持续云端连接的情况下自主运作。为桥接语音、情感与动作,我们提出了基于视觉语言模型的框架 SeM,通过三个关键组件来协调情感一致的多模态交互:捕获用户情境线索的多模态感知模块、用于响应规划的链式思考推理,以及一种新颖的语义序列对齐机制(SSAM),确保语音内容与物理表达之间的精确时序协调。我们实现了基于云端和\underline{\textit{e}}dge-部署的版本(SeM),后者通过知识蒸馏在边缘硬件上高效运行,保持 95% 相对性能。全面评估表明,我们的方法在自然度、情感清晰度和模态一致性方面显著优于单模态基线,推动了社交表达型人形机器人在多样化实际环境中的应用。
引用
@article{arxiv.2602.07434,
title = {Bridging Speech, Emotion, and Motion: a VLM-based Multimodal Edge-deployable Framework for Humanoid Robots},
author = {Songhua Yang and Xuetao Li and Xuanye Fei and Mengde Li and Miao Li},
journal= {arXiv preprint arXiv:2602.07434},
year = {2026}
}