中文

LILE:先深入观察再旁顾其余——一种用于组织病理学档案跨模态信息检索的基于 Transformer 的双注意力网络

计算机视觉与模式识别 2022-03-07 v2 计算与语言 机器学习 图像与视频处理

摘要

近年来,许多应用中的数据量急剧增长。此外,单独使用多种模态的网络时代已基本结束。因此,具备处理能力的双向跨模态数据检索已成为许多研究领域和学科的需求。在医学领域尤其如此,因为数据以多种类型出现,包括各类图像、报告以及分子数据。大多数当代工作应用交叉注意力来突出图像或文本相对于其他模态的关键元素,并试图将它们匹配在一起。然而,无论这些特征在自身模态中多么重要,这些方法通常平等地对待各模态的特征。在本研究中,将提出把自注意力作为一个额外的损失项,以丰富输入到交叉注意力模块中的内部表示。本工作提出了一种带有新损失项的新型架构,以帮助在联合潜在空间中表示图像和文本。在两个基准数据集(即 MS-COCO 和 ARCH)上的实验结果表明了所提方法的有效性。

关键词

引用

@article{arxiv.2203.01445,
  title  = {LILE: Look In-Depth before Looking Elsewhere -- A Dual Attention Network using Transformers for Cross-Modal Information Retrieval in Histopathology Archives},
  author = {Danial Maleki and H. R Tizhoosh},
  journal= {arXiv preprint arXiv:2203.01445},
  year   = {2022}
}