AffordTissue: 针对工具-动作特定组织交互的密集可及性预测
计算机视觉与模式识别
2026-04-03 v1 人工智能
机器人学
图像与视频处理
摘要
手术动作自动化在实现类外科医生灵巧控制方面进展迅速,主要由从演示中学习和视觉-语言-动作模型的进步所驱动。尽管这些方法在桌面实验中已取得成功,但将其转化为临床部署仍然具有挑战性:当前方法在预测仪器将在组织表面上的交互位置方面能力有限,且缺乏显式条件输入以强制工具-动作特定的安全交互区域。针对这一空白,我们引入了 AffordTissue,一个用于在胆囊切除术期间预测工具-动作特定组织可及性区域为密集热图的多模态框架。我们的方法结合了捕捉多视角下工具运动和组织动态的时间视觉编码器、使不同仪器-动作对之间得以泛化的语言条件化,以及用于密集可及性预测的 DiT 风格解码器。我们通过整理和标注 103 台胆囊切除术中的 15,638 个视频片段建立了首个组织可及性基准,涵盖六种独特的工具-动作对,涉及四种器械(钩、钳、剪刀、剪线器)及其相关任务:分离、抓取、剪线和切割。实验表明,与视觉-语言模型基线相比取得了显著提升(20.6 px ASSD 对比 60.2 px),表明我们的任务特定架构在大规模基础模型的密集手术可及性预测上表现更优。通过预测工具-动作特定的组织可及性区域,AffordTissue 为安全手术自动化提供了显式的空间推理,可能解锁指向适当组织区域的显式策略指导,以及在仪器偏离预测安全区域时提前安全停止。
引用
@article{arxiv.2604.01371,
title = {AffordTissue: Dense Affordance Prediction for Tool-Action Specific Tissue Interaction},
author = {Aiza Maksutova and Lalithkumar Seenivasan and Hao Ding and Jiru Xu and Chenhao Yu and Chenyan Jing and Yiqing Shen and Mathias Unberath},
journal= {arXiv preprint arXiv:2604.01371},
year = {2026}
}