InternLM-XComposer2.5-OmniLive:用于长期流式视频和音频交互的综合性多模态系统
计算机视觉与模式识别
2024-12-13 v1 人工智能
计算与语言
摘要
创建能够类似人类认知一样与环境长期交互的 AI 系统一直是长久以来的研究目标。近期发展的多模态大语言模型(MLLMs)在开放世界理解方面取得了显著进展。然而,连续且同步的流式感知、记忆与推理的挑战仍基本未被探索。当前 MLLMs 受限于序列到序列架构,无法同时处理输入和生成响应,类似于无法在感知时进行思考。此外,依赖长上下文存储历史数据在长期交互中是不可行的,因为保留所有信息在成本和效率方面都不实际。因此,本项目并不依赖单一基础模型来执行所有功能,而是借鉴了“Specialized Generalist AI”的概念,引入解耦的流式感知、推理和记忆机制,实现对流式视频和音频输入的实时交互。提出的框架 InternLM-XComposer2.5-OmniLive(IXC2.5-OL)由三个关键模块组成:(1)流式感知模块:实时处理多模态信息,将关键细节存储在记忆中,并在响应用户查询时触发推理。(2)多模态长期记忆模块:整合短期记忆和长期记忆,将短期记忆压缩为长期记忆以实现高效检索和提高准确性。(3)推理模块:响应查询并执行推理任务,与感知和记忆模块协调工作。该项目模拟了人类的认知,使多模态大语言模型能够在时间推移中提供连续且自适应的服务。
引用
@article{arxiv.2412.09596,
title = {InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions},
author = {Pan Zhang and Xiaoyi Dong and Yuhang Cao and Yuhang Zang and Rui Qian and Xilin Wei and Lin Chen and Yifei Li and Junbo Niu and Shuangrui Ding and Qipeng Guo and Haodong Duan and Xin Chen and Han Lv and Zheng Nie and Min Zhang and Bin Wang and Wenwei Zhang and Xinyue Zhang and Jiaye Ge and Wei Li and Jingwen Li and Zhongying Tu and Conghui He and Xingcheng Zhang and Kai Chen and Yu Qiao and Dahua Lin and Jiaqi Wang},
journal= {arXiv preprint arXiv:2412.09596},
year = {2024}
}
备注
Github Repo: https://github.com/InternLM/InternLM-XComposer/tree/main/InternLM-XComposer-2.5-OmniLive