基于 Transformers 的手术指令生成
计算机视觉与模式识别
2021-07-20 v2
摘要
自动手术指令生成是实现术中上下文感知手术辅助的先决条件。然而,从手术场景生成指令具有挑战性,因为这需要联合理解当前视野的手术活动并建模视觉信息与文本描述之间的关系。受开放领域中神经机器翻译与图像字幕任务的启发,我们引入了一种以 transformer 为骨干的编解码网络,结合自批判强化学习,从手术图像生成指令。我们在 DAISI 数据集上评估了方法的有效性,该数据集包含来自多个医学学科的 290 个手术过程。我们的方法在所有字幕评估指标上优于现有基线。结果证明了以 transformer 为骨干的编解码结构在处理多模态上下文方面的优势。
引用
@article{arxiv.2107.06964,
title = {Surgical Instruction Generation with Transformers},
author = {Jinglu Zhang and Yinyu Nie and Jian Chang and Jian Jun Zhang},
journal= {arXiv preprint arXiv:2107.06964},
year = {2021}
}
备注
Accepted to MICCAI 2021