中文

PitVQA++: 用于 Pituitary Surgery 中开放式视觉问答的向量矩阵低秩适配

计算机视觉与模式识别 2025-02-21 v1 人工智能

摘要

视觉语言模型 (VLM) 在视觉问答 (VQA) 中提供了独特的机会,以增强内操作决策,促进直观交互,并显著推进手术教育。然而,开发针对手术 VQA 的 VLM 挑战在于数据有限以及在对预训练权重进行全面微调时发生过拟合和灾难性遗忘。虽然低秩适应 (LoRA) 和矩阵秩适应 (MoRA) 等参数高效技术解决了适应性挑战,但其统一的参数分布忽略了深度网络中的特征层次结构,其中较早的层学习通用特征需要比后期层更多的参数。本工作引入 PitVQA++,配合开放式 PitVQA 数据集,以及向量矩阵低秩适配 (Vector-MoLoRA),这是一种创新的 VLM 微调方法,用于适配 Pituitary 手术中的 GPT-2。开放式 PitVQA 包含约 101,803 帧,来自 25 部程序视频,包含 745,972 条问答句子对,涵盖关键手术要素,如阶段识别、步骤识别、情境理解、工具检测、定位和交互识别。Vector-MoLoRA 整合了 LoRA 和 MoRA 的原则,开发一种矩阵低秩适应策略,采用向量排序为较早的层分配更多参数,逐渐减少后期层的参数。我们的方法在 Open-Ended PitVQA 和 EndoVis18-VQA 数据集上验证,有效缓解了灾难性遗忘,同时显著提升了相对于最近基线的性能。此外,我们的风险-覆盖分析突显了其在处理不确定预测方面的增强可靠性和可信度。我们的源代码和数据集可在 https://github.com/HRL-Mike/PitVQA-Plus 提供。

关键词

引用

@article{arxiv.2502.14149,
  title  = {PitVQA++: Vector Matrix-Low-Rank Adaptation for Open-Ended Visual Question Answering in Pituitary Surgery},
  author = {Runlong He and Danyal Z. Khan and Evangelos B. Mazomenos and Hani J. Marcus and Danail Stoyanov and Matthew J. Clarkson and Mobarakol Islam},
  journal= {arXiv preprint arXiv:2502.14149},
  year   = {2025}
}

备注

9 pages