通过自包含查询的记忆增强多模态大语言模型用于手术视觉问答
计算机视觉与模式识别
2024-11-19 v1 计算与语言
摘要
在手术视觉问答(Surgical VQA)中全面理解手术场景需要对多个对象进行推理。以往的方法使用跨模态融合策略来增强推理能力。然而,这些方法常常在有限的场景理解和问题理解方面存在困难,并且有些依赖外部资源(例如预提取的对象特征),这可能会引入错误并在不同手术环境中泛化能力差。为应对这些挑战,我们提出了SCAN,一个简单而有效的记忆增强框架,利用多模态大语言模型通过自包含查询来改善手术上下文理解。SCAN自主运行,生成两种用于上下文增强的记忆:直接记忆(DM)提供最终答案的多个候选(或提示),间接记忆(IM)由自包含的问题-提示对组成,以捕获更广泛的场景上下文。DM直接辅助回答问题,而IM增强了对超出当前查询的手术场景的理解。对这些对象感知记忆进行推理使模型能够准确解释图像并回答问题。在三个公开可用的手术VQA数据集上的大量实验表明,SCAN实现了最先进的性能,在各种手术场景中提供了更高的准确性和鲁棒性。
引用
@article{arxiv.2411.10937,
title = {Memory-Augmented Multimodal LLMs for Surgical VQA via Self-Contained Inquiry},
author = {Wenjun Hou and Yi Cheng and Kaishuai Xu and Yan Hu and Wenjie Li and Jiang Liu},
journal= {arXiv preprint arXiv:2411.10937},
year = {2024}
}