重新思考手术字幕生成:使用图像块的端到端基于窗口的MLP Transformer
计算机视觉与模式识别
2022-07-04 v1
摘要
手术字幕生成在手术指令预测和报告生成中起着重要作用。然而,大多数字幕模型仍依赖计算繁重的物体检测器或特征提取器来提取区域特征。此外,检测模型需要额外的边界框标注,成本高且需熟练标注者。这导致推理延迟,并限制字幕模型部署于实时机器人手术。为此,我们利用基于块移位窗口技术设计了一个端到端无检测器和特征提取器的字幕模型。我们提出基于移位窗口的多层感知机Transformer字幕模型(SwinMLP-TranCAP),具有更快推理速度和更少计算量。SwinMLP-TranCAP用基于窗口的多头MLP替换多头注意力模块。此类部署主要关注图像理解任务,但极少有工作探究字幕生成任务。SwinMLP-TranCAP还通过使用3D块和窗口扩展为视频版本以用于视频字幕任务。与先前基于检测器或特征提取器的模型相比,我们的模型极大简化了架构设计,同时在两个手术数据集上保持性能。代码公开于 https://github.com/XuMengyaAmy/SwinMLP_TranCAP。
引用
@article{arxiv.2207.00113,
title = {Rethinking Surgical Captioning: End-to-End Window-Based MLP Transformer Using Patches},
author = {Mengya Xu and Mobarakol Islam and Hongliang Ren},
journal= {arXiv preprint arXiv:2207.00113},
year = {2022}
}
备注
10 pages