Agent AI:多模态交互的视野调查
人工智能
2024-01-29 v2 人机交互
机器学习
摘要
多模态AI系统很可能成为我们日常生活中无处不在的存在。使这些系统更具交互性的一种有前景的方法是将它们具身化为物理和虚拟环境中的智能体。目前,系统利用现有基础模型作为创建具身智能体的基本构建块。将智能体嵌入此类环境中,有助于模型处理和解释视觉与上下文数据,这对于创建更复杂且具有上下文感知能力的AI系统至关重要。例如,能够感知用户动作、人类行为、环境物体、音频表达以及场景整体情感的系统,可用于在给定环境中指导智能体响应。为加速基于智能体的多模态智能研究,我们将“Agent AI”定义为一类交互式系统,能够感知视觉刺激、语言输入和其他环境基础数据,并产生有意义的具身动作。特别地,我们探索了旨在通过结合外部知识、多感官输入和人类反馈来改进基于下一具身动作预测的智能体的系统。我们认为,通过在具身环境中开发智能体AI系统,还可以减轻大型基础模型的幻觉及其生成环境不正确输出的倾向。新兴的Agent AI领域涵盖了多模态交互中更广泛的具身和智能体方面。除了在物理世界中行动和交互的智能体,我们设想一个未来,人们可以轻松创建任何虚拟现实或模拟场景,并与具身于虚拟环境中的智能体进行交互。
引用
@article{arxiv.2401.03568,
title = {Agent AI: Surveying the Horizons of Multimodal Interaction},
author = {Zane Durante and Qiuyuan Huang and Naoki Wake and Ran Gong and Jae Sung Park and Bidipta Sarkar and Rohan Taori and Yusuke Noda and Demetri Terzopoulos and Yejin Choi and Katsushi Ikeuchi and Hoi Vo and Li Fei-Fei and Jianfeng Gao},
journal= {arXiv preprint arXiv:2401.03568},
year = {2024}
}