中文

DaFoEs:混合数据集以实现微创机器人手术中视觉-状态深度学习力估计的泛化

计算机视觉与模式识别 2024-01-25 v1 人工智能 机器人学

摘要

在微创机器人手术(MIRS)的安全交互过程中精确确定接触力仍然是一个开放的研究挑战。受术后手术视频定性分析的启发,使用跨模态数据驱动的深度神经网络模型已成为预测无传感器力趋势的最新方法之一。然而,这些方法需要目前尚不可用的大规模且多样化的数据集。在本文中,我们提出了一个新的视觉-触觉数据集(DaFoEs),其中包含可变的软环境,用于深度神经模型的训练。为了减少单一数据集的偏差,我们提出了一种流水线,用于泛化不同的视觉和状态数据输入以进行混合数据集训练,并使用先前验证过的不同设置的数据集。最后,我们提出了一种可变的编码器-解码器架构,使用单输入或输入序列来预测腹腔镜工具施加的力。对于输入序列,我们使用循环解码器(前缀为R)和一种新的时间采样来表示工具的加速度。在训练过程中,我们证明单一数据集训练容易过拟合到训练数据域,但在跨新域迁移结果时存在困难。然而,数据集混合表现出良好的迁移效果,循环模型和非循环模型的平均相对估计力误差分别为5%和12%。我们的方法还略微提高了Transformer在力估计中的有效性,随着可用数据量增加150%,最大提升约15%。总之,我们证明了在MIRS中混合实验设置进行视觉-状态力估计是迈向该问题通用解决方案的一种可行方法。

关键词

引用

@article{arxiv.2401.09239,
  title  = {DaFoEs: Mixing Datasets towards the generalization of vision-state deep-learning Force Estimation in Minimally Invasive Robotic Surgery},
  author = {Mikel De Iturrate Reyzabal and Mingcong Chen and Wei Huang and Sebastien Ourselin and Hongbin Liu},
  journal= {arXiv preprint arXiv:2401.09239},
  year   = {2024}
}