一对一其余注意力:面向生物医学数据的可扩展多模态融合
机器学习
2024-10-23 v4
摘要
多模态学习模型已变得日益重要,因为它们在从问答到自动驾驶的多种任务上超越了单模态方法。尽管多模态学习十分重要,现有工作聚焦于 NLP 应用,其中模态数量通常少于四种(音频、视频、文本、图像)。然而,其他领域(如医学领域)的数据输入可能包括 X 射线、PET 扫描、MRI、基因筛查、临床笔记等,从而产生了对高效且准确的信息融合的需求。许多最先进模型依赖于成对跨模态注意力,其对于超过三种模态的应用扩展性不佳。对于 种模态,计算注意力将产生 次操作,可能耗费大量计算资源。为此,我们提出了一种与领域无关的注意力机制——一对一其余(OvO)注意力,其随模态数量线性扩展且仅需 次注意力操作,因而相比现有跨模态注意力算法显著降低了计算复杂度。使用三个不同的真实世界数据集以及一项额外的模拟实验,我们表明,与流行的融合技术相比,我们的方法在降低计算成本的同时提升了性能。
引用
@article{arxiv.2307.05435,
title = {One-Versus-Others Attention: Scalable Multimodal Integration for Biomedical Data},
author = {Michal Golovanevsky and Eva Schiller and Akira Nair and Eric Han and Ritambhara Singh and Carsten Eickhoff},
journal= {arXiv preprint arXiv:2307.05435},
year = {2024}
}