中文

AUGUSTUS:基于上下文化用户记忆的LLM驱动多模态智能体系统

人工智能 2025-10-20 v1

摘要

在大型语言模型(LLM)成功于检索增强生成(RAG)的推动下,增强智能体系统以外部分析数据库存储信息的兴趣日益增长。然而,现有系统专注于存储文本信息,忽视了多模态信号的重要性。以人类认知科学中记忆的多模态特性为灵感,本文提出AUGUSTUS,一个多模态智能体系统。技术上,系统由四个环节组成:(i)编码:理解输入;(ii)存储于记忆:保存重要信息;(iii)检索:从记忆中搜索相关上下文;(iv)行动:执行任务。不同于使用向量数据库的传统方法,本文将信息概念化为语义标签,并将标签与其上下文关联,存储于图结构的多模态语境记忆中以实现高效的概念驱动检索。实验表明,AUGUSTUS在ImageNet分类中超越传统多模态RAG方法,速度提升3.5倍,并在MSC基准上超越MemGPT。

关键词

引用

@article{arxiv.2510.15261,
  title  = {AUGUSTUS: An LLM-Driven Multimodal Agent System with Contextualized User Memory},
  author = {Jitesh Jain and Shubham Maheshwari and Ning Yu and Wen-mei Hwu and Humphrey Shi},
  journal= {arXiv preprint arXiv:2510.15261},
  year   = {2025}
}

备注

LAW 2025 Workshop at NeurIPS 2025. Work done from late 2023 to early 2024