中文

病理视觉问答

计算机视觉与模式识别 2020-10-26 v1

摘要

是否有可能开发一位能够通过美国病理学委员会(ABP)认证考试的“AI 病理学家”?要构建这样的系统,需要应对三个挑战。首先,我们需要创建一个视觉问答(VQA)数据集,其中向 AI 智能体展示一张病理图像及一个问题,并要求其给出正确答案。出于隐私考虑,病理图像通常不公开。此外,只有训练有素的病理学家才能理解病理图像,但他们几乎无暇协助创建 AI 研究数据集。第二个挑战是:由于难以聘请经验丰富的病理学家来创建病理视觉问答,所得的病理 VQA 数据集可能包含错误。使用这些有噪声甚至错误的数据训练病理 VQA 模型,将导致无法在未见图像上良好泛化的有问题模型。第三个挑战是:病理问答对中所涵盖的医学概念与知识非常多样,而可用于建模训练的问答对数量有限。如何基于有限数据学习多样医学概念的有效表示在技术上要求很高。本文旨在应对这三个挑战。据我们所知,我们的工作是首个解决病理 VQA 问题的工作。针对缺乏公开病理 VQA 数据集的问题,我们创建了 PathVQA 数据集。针对第二个挑战,我们提出了一种学习即忽略(learning-by-ignoring)方法。针对第三个挑战,我们提出使用跨模态自监督学习。我们在所创建的 PathVQA 数据集上进行了实验,结果证明了我们提出的学习即忽略方法与跨模态自监督学习方法的有效性。

关键词

引用

@article{arxiv.2010.12435,
  title  = {Pathological Visual Question Answering},
  author = {Xuehai He and Zhuo Cai and Wenlan Wei and Yichen Zhang and Luntian Mou and Eric Xing and Pengtao Xie},
  journal= {arXiv preprint arXiv:2010.12435},
  year   = {2020}
}

备注

arXiv admin note: text overlap with arXiv:2003.10286