基于多任务与多模态学习的手术手势与任务联合分类
计算机视觉与模式识别
2018-05-03 v1
摘要
我们提出了一种新颖的多模态多任务架构,用于在机器人辅助手术(RAS)视频中同时进行分类的低层手势与手术任务分类。我们的端到端架构基于长短期记忆网络(LSTM)的原理,联合学习视觉与运动特征丰富表示上的时间动态,同时对手势与手术任务活动进行分类。实验结果表明,与分别在视觉线索和运动线索上对手势和手术任务单独分类的架构相比,我们的方法更优。我们在一组固定的随机 1200 个手势视频片段上训练模型,并使用其余 422 个进行测试。这导致约 42,000 个手势帧用于训练,14,500 个用于测试。在 6 折实验中,常规方法仅达到平均精度(AP)29%(29.13%),而我们的架构在 3 个任务和 14 个可能手势标签下达到 AP 51%(50.83%),提升了 22%(21.7%)。我们的架构在互为补充以用于低层手势与手术任务分类的视觉与运动特征丰富表示上学习时间动态。其多任务学习特性利用了学习到的联合关系以及共享与任务特定表示的组合。基准研究侧重于识别特定任务下发生的手势,而我们侧重于识别跨不同任务和设置重复出现的常见手势,并且相比常规架构性能显著更优。
引用
@article{arxiv.1805.00721,
title = {Joint Surgical Gesture and Task Classification with Multi-Task and Multimodal Learning},
author = {Duygu Sarikaya and Khurshid A. Guru and Jason J. Corso},
journal= {arXiv preprint arXiv:1805.00721},
year = {2018}
}
备注
Keywords Robot-Assisted Surgery, Surgical Gesture Classification, Multi-task Learning, Multimodal Learning, Long Short-term Recurrent Neural Networks, Convolutional Neural Networks