中文

医学领域中的视觉问答

计算机视觉与模式识别 2023-09-21 v1

摘要

医学视觉问答(Med-VQA)是一项机器学习任务,旨在构建一个能够基于给定医学图像回答自然语言问题的系统。尽管通用 VQA 任务已取得快速进展,但由于缺乏大规模标注数据集,Med-VQA 的进展较少。在本文中,我们提出领域特定的预训练策略,包括一种新颖的对比学习预训练方法,以缓解 Med-VQA 任务中小数据集的问题。我们发现模型受益于使用更少参数的组件。我们还使用证据验证技术评估并讨论了模型的视觉推理。我们提出的模型在 VQA-Med 2019 测试集上取得了 60% 的准确率,与其他最先进的 Med-VQA 模型结果相当。

关键词

引用

@article{arxiv.2309.11080,
  title  = {Visual Question Answering in the Medical Domain},
  author = {Louisa Canepa and Sonit Singh and Arcot Sowmya},
  journal= {arXiv preprint arXiv:2309.11080},
  year   = {2023}
}

备注

8 pages, 7 figures, Accepted to DICTA 2023 Conference