中文

面向混合现实的多模态细粒度训练助手的自主工作流

计算与语言 2024-06-07 v2 人工智能 人机交互

摘要

自主人工智能(AI)智能体已成为自动理解基于语言环境的极具前景的协议,特别是随着大型语言模型(LLMs)的指数级发展。然而,对多模态环境的细粒度、全面理解仍有待深入探索。这项工作设计了一个自主工作流,专为将AI智能体无缝集成到扩展现实(XR)应用中以进行细粒度训练而定制。我们在一个试点XR环境中展示了用于乐高积木组装的多模态细粒度训练助手。具体而言,我们设计了一个中枢语言智能体,将LLM与记忆、规划以及与XR工具的交互和视觉-语言智能体集成在一起,使智能体能够根据过往经验决定其行动。此外,我们引入了LEGO-MRTA,这是一个在由商业LLM服务的工作流中自动合成的多模态细粒度组装对话数据集。该数据集包含多模态指令手册、对话、XR响应和视觉问答。最后,我们提出了几个主流的开源LLM作为基准,评估它们在所提出数据集上进行与未进行微调的性能。我们预期该工作流的更广泛影响将推动更智能助手的发展,以实现XR环境中的无缝用户交互,从而促进AI和人机交互(HCI)社区的研究。

关键词

引用

@article{arxiv.2405.13034,
  title  = {Autonomous Workflow for Multimodal Fine-Grained Training Assistants Towards Mixed Reality},
  author = {Jiahuan Pei and Irene Viola and Haochen Huang and Junxiao Wang and Moonisa Ahsan and Fanghua Ye and Jiang Yiming and Yao Sai and Di Wang and Zhumin Chen and Pengjie Ren and Pablo Cesar},
  journal= {arXiv preprint arXiv:2405.13034},
  year   = {2024}
}

备注

Accepted by ACL 2024