中文

视觉检索增强生成与理解:综述与新视角

计算机视觉与模式识别 2025-03-25 v1

摘要

检索增强生成(RAG)已成为人工智能(AI)中的关键技术,尤其是通过访问外部、可靠和最新知识源来增强大型语言模型(LLMs)的能力。在AI生成内容(AIGC)上下文中,RAG通过增强模型输出中补充相关信息来提高其质量。最近,RAG的潜力已扩展到自然语言处理之外, emerging methods 将检索增强策略集成到计算机视觉(CV)领域。这些方法旨在通过整合权威外部知识库来克服仅依赖内部模型知识的局限性,从而提高视觉模型的理解和生成能力。本综述提供了关于计算机视觉中检索增强技术当前状态的全面综述,关注两个主要领域:(I)视觉理解;(II)视觉生成。在视觉理解领域,我们系统回顾了从基本图像识别到医学报告生成和多模态问答等复杂应用的任务。对于视觉内容生成,我们审查了RAG在图像、视频和3D生成任务中的应用。此外,我们探讨了RAG for embodied AI的最新进展,特别是关注规划、任务执行、多模态感知、交互和特定领域的应用。鉴于在计算机视觉中集成检索增强技术仍处于早期阶段,我们还概述了当前方法的关键局限性,并提出了推动该领域发展的未来研究方向。

关键词

引用

@article{arxiv.2503.18016,
  title  = {Retrieval Augmented Generation and Understanding in Vision: A Survey and New Outlook},
  author = {Xu Zheng and Ziqiao Weng and Yuanhuiyi Lyu and Lutao Jiang and Haiwei Xue and Bin Ren and Danda Paudel and Nicu Sebe and Luc Van Gool and Xuming Hu},
  journal= {arXiv preprint arXiv:2503.18016},
  year   = {2025}
}

备注

19 pages, 10 figures