中文

用于医疗教学视频分类与问答的数据集

计算机视觉与模式识别 2022-02-01 v1 计算与语言

摘要

本文引入了一项新挑战与数据集,以促进面向设计能够理解医疗视频并对自然语言问题提供视觉回答系统的研究。我们相信医疗视频可为许多急救、医疗紧急情况和医学教育问题提供最佳可能的答案。为此,我们创建了 MedVidCL 与 MedVidQA 数据集,并引入医疗视频分类(MVC)与医疗视觉答案定位(MVAL)任务,这两个任务聚焦于跨模态(医疗语言与医疗视频)理解。所提任务与数据集有潜力支持可惠及公众与医疗从业者的复杂下游应用的开发。我们的数据集包含用于 MVC 任务的 6,117 个标注视频,以及来自 899 个视频的用于 MVAL 任务的 3,010 个带时间戳的标注问答。这些数据集已由医学信息学专家核验与修正。我们还使用所创建的 MedVidCL 与 MedVidQA 数据集对每个任务进行了基准测试,并提出了为多模态学习方法设定具有竞争力基线以供未来研究的方法。

关键词

引用

@article{arxiv.2201.12888,
  title  = {A Dataset for Medical Instructional Video Classification and Question Answering},
  author = {Deepak Gupta and Kush Attal and Dina Demner-Fushman},
  journal= {arXiv preprint arXiv:2201.12888},
  year   = {2022}
}