面向超声的自监督对比视频-语音表征学习
计算机视觉与模式识别
2020-08-18 v1
摘要
在医学影像中,人工标注的获取成本高昂,有时甚至无法获得,这使得传统的基于深度学习的模型难以扩展。因此,如果能从原始数据中无需人工标注地推导出有用表征,将大有裨益。在本文中,我们提出解决基于多模态超声视频-语音原始数据的自监督表征学习问题。对于该情形,我们假设超声视频与相应的超声医师叙述语音音频之间存在高度相关性。为了学习有意义的表征,模型需要识别这种相关性,同时理解底层的解剖特征。我们设计了一个框架,在没有任何人工标注的情况下对视频与音频之间的对应关系进行建模。在该框架内,我们引入了跨模态对比学习和一种亲和度感知的自步学习方案来增强相关性建模。在多模态胎儿超声视频和音频上的实验评估表明,所提方法能够学习到强表征,并很好地迁移到标准平面检测和眼动注视预测等下游任务。
引用
@article{arxiv.2008.06607,
title = {Self-supervised Contrastive Video-Speech Representation Learning for Ultrasound},
author = {Jianbo Jiao and Yifan Cai and Mohammad Alsharid and Lior Drukker and Aris T. Papageorghiou and J. Alison Noble},
journal= {arXiv preprint arXiv:2008.06607},
year = {2020}
}
备注
MICCAI 2020 (early acceptance)