中文

昔日盲然今得见:在社会机器人中实现视觉赋能对话

机器人学 2025-04-14 v1 人工智能 人机交互

摘要

在快速发展的人机交互领域,将视觉能力集成到对话智能体中是一项关键进展。本文提出了一个对话管理器的初步实现,其利用大语言模型(如 GPT-4、IDEFICS)的最新进展,以实时视觉输入增强传统的基于文本的提示。LLM 用于解释文本提示与视觉刺激,从而创建更具上下文感知能力的对话智能体。该系统的提示工程结合了对话与图像摘要,确保了上下文保留与计算效率之间的平衡。本文报告了由该系统驱动的 Furhat 机器人的六次交互,对所得结果进行了说明与讨论。通过实现这一视觉赋能对话系统,本文展望了一个对话智能体无缝融合文本与视觉模态、实现更丰富且更具上下文感知对话的未来。

关键词

引用

@article{arxiv.2311.08957,
  title  = {I Was Blind but Now I See: Implementing Vision-Enabled Dialogue in Social Robots},
  author = {Giulio Antonio Abbo and Tony Belpaeme},
  journal= {arXiv preprint arXiv:2311.08957},
  year   = {2025}
}

备注

8 pages, 3 figures