中文

面向深度学习光学微型机器人姿态与深度感知的数据集与基准

机器人学 2025-05-27 v1

摘要

光学微型机器人通过光学挤压装置(OT)进行操控,具有广泛的生物医学应用前景。然而,由于微型机器人呈现透明或低对比度特征,以及微尺度环境中噪声和动态条件的挑战,可靠的姿态与深度感知仍是基本难题。公开数据集对于实现可重复的研究、促进基准测试以及加快针对微尺度挑战的感知模型开发至关重要。标准化的评估使不同算法之间能够保持一致的比较,确保客观的基准测试并促进可重复的研究。本文介绍了 OpTical MicroRobot dataset (OTMR),即首个支持光学显微镜下微型机器人感知的公开数据集。OTMR 包含 232,881 张图片,覆盖 18 种微型机器人类型和 176 个不同姿态。我们对八个深度学习模型(包括通过神经网络架构搜索(NAS)获得的架构)在两个关键任务上的性能进行了基准测试:姿态分类和深度回归。结果表明,Vision Transformer(ViT) 在姿态分类中取得最高准确率,而深度回归受益于更深的网络结构。此外,训练数据集的增大会在两个任务中带来显著的改进,突显了 OTMR 作为面向复杂微尺度环境中稳健和可泛化微型机器人感知基础资源的潜力。

关键词

引用

@article{arxiv.2505.18303,
  title  = {A Dataset and Benchmarks for Deep Learning-Based Optical Microrobot Pose and Depth Perception},
  author = {Lan Wei and Dandan Zhang},
  journal= {arXiv preprint arXiv:2505.18303},
  year   = {2025}
}

备注

Accepted by the 2025 International Conference on Manipulation, Automation and Robotics at Small Scales (MARSS)