中文

从说中展示:临床环境中的视听建模

计算机视觉与模式识别 2023-10-26 v1

摘要

听觉和视觉信号通常同时出现并相互关联,这不仅存在于自然环境中,也存在于临床环境中。然而,由于音频/视频信号的不同来源以及听觉信号(通常是语音)中的噪声(包括信号级和语义级),后一种情况下的视听建模更具挑战性。本文考虑临床环境中的视听建模,提供了一种无需人类专家标注即可学习有益于各种临床任务的医疗表征的解决方案。为此,我们提出了一种简单而有效的多模态自监督学习框架。所提出的方法能够仅以语音音频为参考,在超声成像过程中定位感兴趣的解剖区域。在大规模临床多模态超声视频数据集上的实验评估表明,所提出的自监督方法学习到了良好的可迁移解剖表征,提升了自动化下游临床任务的性能,甚至优于全监督解决方案。

关键词

引用

@article{arxiv.2310.16477,
  title  = {Show from Tell: Audio-Visual Modelling in Clinical Settings},
  author = {Jianbo Jiao and Mohammad Alsharid and Lior Drukker and Aris T. Papageorghiou and Andrew Zisserman and J. Alison Noble},
  journal= {arXiv preprint arXiv:2310.16477},
  year   = {2023}
}