中文

超越边界的视觉:人机交互中领域特定大型视觉模型的初始设计空间

人机交互 2024-09-17 v5 机器人学

摘要

大型视觉模型(LVM)的出现紧随近年来大型语言模型(LLM)的繁荣。然而,在将LVM应用于人机交互(HRI)的结构化研究方面存在明显空白,尽管有大量证据支持视觉模型在增强人机交互方面的有效性。认识到其广阔且可预期的潜力,我们引入了一个初始设计空间,其中包含领域特定的大型视觉模型,这些模型因其优于普通模型的性能而被选中。我们深入探讨了三个主要维度:HRI上下文、基于视觉的任务和特定领域。在15位专家中进行了实证评估,涵盖六个评估指标,展示了在相关决策场景中的主要有效性。我们探索了构思过程和潜在应用场景,将这一设计空间视为未来HRI系统设计的基础指南,强调准确的领域对齐和模型选择。

关键词

引用

@article{arxiv.2404.14965,
  title  = {Vision Beyond Boundaries: An Initial Design Space of Domain-specific Large Vision Models in Human-robot Interaction},
  author = {Yuchong Zhang and Yong Ma and Danica Kragic},
  journal= {arXiv preprint arXiv:2404.14965},
  year   = {2024}
}