面向语言提示的数字孪生体的智能控制器
机器人学
2024-12-12 v1 人工智能
计算机视觉与模式识别
人机交互
机器学习
摘要
然而,语言界面需要解释X射线图像以创建语义表示以进行推理的专用AI模型。语言控制的固定输出限制了其功能。通过语言对齐的灵活AI模型实现更具多样性的接口。我们使用语言对齐的X射线图像分割基础模型,持续更新基于稀疏重建的患者数字孪生体。支持可视化、患者特定视角查找和自动从新视角进行夹具调节等自主功能,使命令'聚焦于下腰椎'成为可能。在尸体研究中,用户通过语音命令实现了对躯干结构的可视化、定位和夹具调节,端到端成功率达84%。后验分析显示,患者数字孪生体可将35个常请求结构定位到51.68mm以内,实现从任意姿态的定位与隔离。我们的结果表明,智能器械X射线系统可直接整合医生的意图。虽然现有内操作X射线分析基础模型存在局限,但随着改进可促进高度灵活的智能C臂。
引用
@article{arxiv.2412.08020,
title = {Intelligent Control of Robotic X-ray Devices using a Language-promptable Digital Twin},
author = {Benjamin D. Killeen and Anushri Suresh and Catalina Gomez and Blanca Inigo and Christopher Bailey and Mathias Unberath},
journal= {arXiv preprint arXiv:2412.08020},
year = {2024}
}