CUE-M:基于多模态大型语言模型的上下文理解与增强搜索
计算与语言
2025-03-24 v3
摘要
检索增强生成(RAG)与多模态大型语言模型(MLLMs)的集成彻底改变了信息检索,并扩展了人工智能的实际应用。然而,当前的系统在准确解释用户意图、采用多样化检索策略以及有效过滤意外或不当回复方面存在困难,限制了其有效性。本文介绍了基于 MLLM 的上下文理解与增强搜索(CUE-M),这是一个新颖的多模态搜索框架,通过包含图像上下文丰富、意图细化、上下文查询生成、外部 API 集成和基于相关性的过滤的多阶段流水线来解决这些挑战。CUE-M 结合了一个鲁棒的过滤流水线,融合了基于图像、基于文本和多模态的分类器,能够动态适应由组织策略定义的实例和类别特定关注点。在基于知识的 VQA 和安全性的真实世界数据集和公共基准上进行的大量实验表明,CUE-M 优于基线并确立了新的 SOTA 结果,提升了多模态检索系统的能力。
引用
@article{arxiv.2411.12287,
title = {CUE-M: Contextual Understanding and Enhanced Search with Multimodal Large Language Model},
author = {Dongyoung Go and Taesun Whang and Chanhee Lee and Hwa-Yeon Kim and Sunghoon Park and Seunghwan Ji and Jinho Kim and Dongchan Kim and Young-Bum Kim},
journal= {arXiv preprint arXiv:2411.12287},
year = {2025}
}
备注
Preprint. Under review