面向机器人辅助手术的未来帧预测
计算机视觉与模式识别
2021-03-19 v1
摘要
预测机器人手术视频的未来帧是一个有趣、重要但极具挑战的问题,因为手术任务可能具有复杂动态。现有自然视频未来预测方法基于确定性模型或随机模型,包括深度循环神经网络、光流和潜空间建模。然而,预测手术场景中双臂机器人有意义运动这一潜力迄今未被发掘,其通常比预测自然场景中单臂机器人的独立运动更具挑战性。本文中,我们提出一种三元先验引导变分自编码器(TPG-VAE)模型,用于机器人手术视频序列的未来帧预测。除内容分布外,我们的模型学习运动分布,这在处理手术器械微小运动上是新颖的。此外,我们将来自手势类别的不变先验信息加入生成过程以约束模型的潜空间。据我们所知,这是首次在考虑相对于通用机器人视频独特特性的情况下预测双臂机器人未来帧。实验表明,我们的模型在公开JIGSAWS数据集的缝合任务上获得了更稳定且真实的未来帧预测场景。
引用
@article{arxiv.2103.10308,
title = {Future Frame Prediction for Robot-assisted Surgery},
author = {Xiaojie Gao and Yueming Jin and Zixu Zhao and Qi Dou and Pheng-Ann Heng},
journal= {arXiv preprint arXiv:2103.10308},
year = {2021}
}
备注
IPMI2021