V$^2$-SfMLearner:用于多模态无线经皮肠镜的单目深度与自身运动学习
计算机视觉与模式识别
2024-12-24 v1 人工智能
机器人学
摘要
深度学习可从经皮肠镜视频中预测深度图与胶囊自身运动,辅助三维场景重建与病灶定位。然而,胶囊经皮肠镜在胃肠道内碰撞导致运动数据中存在振动扰动。现有解决方案仅关注基于视觉的处理,忽略了如振动等其他辅助信号——这些信号可降低噪声并提升性能。因此,我们提出 V-SfMLearner,一种将振动信号融入视觉基深度与胶囊运动估计的多模态方法。我们构建了一个包含振动与视觉信号的多模态经皮肠镜数据集,并开发了基于视觉-振动信号的无监督方法,有效通过多模态学习消除振动扰动。具体而言,我们仔细设计了振动网络分支与傅里叶融合模块,用于检测与抑制振动噪声。该融合框架与流行的视觉单模态算法兼容。大量在多模态数据集上的验证表明,我们的方法在性能与鲁棒性方面均优于视觉单模态方法。无需大型外部设备,V-SfMLearner 有望集成至临床胶囊机器人中,为实时可靠的消化检查提供工具。研究结论显示,其应用前景广阔,可提升医生的诊断能力。
引用
@article{arxiv.2412.17595,
title = {V$^2$-SfMLearner: Learning Monocular Depth and Ego-motion for Multimodal Wireless Capsule Endoscopy},
author = {Long Bai and Beilei Cui and Liangyu Wang and Yanheng Li and Shilong Yao and Sishen Yuan and Yanan Wu and Yang Zhang and Max Q. -H. Meng and Zhen Li and Weiping Ding and Hongliang Ren},
journal= {arXiv preprint arXiv:2412.17595},
year = {2024}
}
备注
To appear in IEEE Transactions on Automation Science and Engineering (IEEE TASE)