中文

重新审视蒸馏用于机器人手术中视觉问答定位回答的持续学习

计算机视觉与模式识别 2023-07-25 v1 计算与语言 机器人学

摘要

视觉问答定位回答(VQLA)系统可作为手术教育中有知识的助手。除提供基于文本的回答外,VQLA系统还能高亮关注区域以增进手术场景理解。然而,深度神经网络(DNNs)在学习新知识时遭受灾难性遗忘。具体而言,当DNNs在增量类别或任务上学习时,其在旧任务上的性能急剧下降。此外,由于医疗数据隐私与许可问题,更新持续学习(CL)模型时往往难以获取旧数据。因此,我们开发了无范例持续手术VQLA框架,以在序列学习范式中探索并平衡DNNs的僵性-可塑性权衡。我们重新审视CL任务中的蒸馏损失,并提出僵性-可塑性感知蒸馏(RP-Dist)与自校准异构蒸馏(SH-Dist)以保留旧知识。权重对齐(WA)技术也被整合以调整新旧任务间的权重偏置。我们进一步在三个公开手术数据集上建立了手术场景下的CL框架,其包含新旧手术VQLA任务间重叠的类别。通过大量实验,我们证明了所提方法在持续手术VQLA上相较常规CL方法出色地调和了学习与遗忘。我们的代码已公开可用。

关键词

引用

@article{arxiv.2307.12045,
  title  = {Revisiting Distillation for Continual Learning on Visual Question Localized-Answering in Robotic Surgery},
  author = {Long Bai and Mobarakol Islam and Hongliang Ren},
  journal= {arXiv preprint arXiv:2307.12045},
  year   = {2023}
}

备注

To appear in MICCAI 2023. Code availability: https://github.com/longbai1006/CS-VQLA