中文

面向医疗解释机器人手势的开源大语言模型视觉语言系统

机器人学 2026-03-09 v1 人机交互

摘要

在医疗保健领域,尤其是在跨语言障碍的情况下,有效沟通至关重要,其中非语言线索和手势在沟通中发挥着关键作用。本文提出了一个面向医疗解释机器人的隐私保护视觉语言框架,用于检测特定语音行为(同意和指令),并生成相应的机器人手势。该系统基于本地部署的开源模型构建,利用大语言模型(LLM)进行少样本提示下的意图检测。我们还引入了一个标注了语音行为并配有手势剪辑的临床对话新型数据集。我们的识别模块实现了 0.90 的准确率、0.93 的加权精确率和 0.91 的加权 F1 分数。我们的方法显著提高了计算效率,并且在用户研究中,相较于语音-手势生成基线,人类化程度更高,同时保持了可接受的恰当性。

关键词

引用

@article{arxiv.2603.05751,
  title  = {Vision-Language System using Open-Source LLMs for Gestures in Medical Interpreter Robots},
  author = {Thanh-Tung Ngo and Emma Murphy and Robert J. Ross},
  journal= {arXiv preprint arXiv:2603.05751},
  year   = {2026}
}