基于大语言模型辅助的多教师持续学习用于机器人手术中的视觉问答
信息检索
2024-10-24 v3
摘要
视觉问答对于促进外科教育至关重要。在实践中,受训者的需求不断演变,例如学习更多手术类型、适应不同机器人、以及学习各种手术的新器械和技术。然而,患者数据隐私通常限制了更新模型时旧数据的可用性,因此需要无样本的持续学习设置。先前的持续学习研究忽略了外科领域中的两个关键问题:1)来自多个来源的不同手术操作带来的大领域偏移,以及2)由手术器械或活动的不均匀出现导致的严重数据不平衡。本文提出利用多模态大语言模型和自适应权重分配方法来解决这些问题。我们首先开发了一个新的多教师持续学习框架,利用多模态大语言模型作为额外教师。大语言模型的强泛化能力可以在领域偏移和数据不平衡发生时弥合知识差距。然后,我们提出了一种新颖的数据处理方法,将复杂的大语言模型嵌入转换为与我们的持续学习框架兼容的logits。我们进一步设计了一种自适应权重分配方法,以平衡大语言模型的泛化能力和旧持续学习模型的领域专业知识。最后,为全面测试我们提出方法的有效性,我们还构建了两个与现有数据集大不相同的新手术视觉问答数据集,这些数据集可能成为未来研究的宝贵资源。在测试数据集上的大量实验结果证明了我们的方法相对于其他先进持续学习方案的优越性。
引用
@article{arxiv.2402.16664,
title = {LLM-Assisted Multi-Teacher Continual Learning for Visual Question Answering in Robotic Surgery},
author = {Yuyang Du and Kexin Chen and Yue Zhan and Chang Han Low and Tao You and Mobarakol Islam and Ziyu Guo and Yueming Jin and Guangyong Chen and Pheng-Ann Heng},
journal= {arXiv preprint arXiv:2402.16664},
year = {2024}
}
备注
This paper has been accapted by 2024 IEEE International Conference on Robotics and Automation (ICRA)