使用低秩适配的视觉语言模型估计外科手术器具的 2D 关键点
计算机视觉与模式识别
2025-08-29 v1
摘要
本文提出了一种 novel 流程,用于通过利用采用低秩调整(LoRA)技术微调的视觉语言模型(VLM)来估计外科手术器具的 2D 关键点。不同于传统的卷积神经网络(CNN)或基于变换器的方法,这些方法常常在小规模医学数据集上容易过拟合,我们的方法利用预训练 VLM 的泛化能力。我们仔细设计提示来创建 instruction-tuning 数据集,并使用它们将视觉特征与语义关键点描述对齐。实验结果表明,仅通过两个 epoch 的微调,适应后的 VLM 就超过了基线模型,展示了 LoRA 在低资源场景中的有效性。该方法不仅提高了关键点检测性能,也为未来的 3D 手术手和工具姿态估计指明了道路。
引用
@article{arxiv.2508.20830,
title = {Estimating 2D Keypoints of Surgical Tools Using Vision-Language Models with Low-Rank Adaptation},
author = {Krit Duangprom and Tryphon Lambrou and Binod Bhattarai},
journal= {arXiv preprint arXiv:2508.20830},
year = {2025}
}
备注
Accepted to MICCAI 2025