MultiModN——多模态、多任务、可解释模块化网络
机器学习
2023-11-07 v2
摘要
在单一模型中预测多个真实世界任务通常需要特别多样的特征空间。多模态(MM)模型旨在提取多种数据类型的协同预测潜力,以创建一个共享特征空间,并在尺寸差异极大的输入(即图像、文本、声音)间实现对齐的语义含义。当前大多数 MM 架构并行融合这些表示,这不仅限制了其可解释性,还造成对模态可用性的依赖。我们提出 MultiModN,一种多模态、模块化网络,它以任意数量、组合或类型的模态序列融合潜在表示,同时对任意数量或组合的预测任务提供细粒度实时预测反馈。MultiModN 的可组合流水线在设计上即可解释,并且天生多任务,对偏倚缺失这一根本问题具有鲁棒性。我们在多个基准 MM 数据集上进行了四项实验,涵盖 10 个真实世界任务(预测医学诊断、学业表现和天气),结果表明 MultiModN 的序列式 MM 融合与并行融合基线相比并不牺牲性能。通过模拟非随机缺失(MNAR)这一挑战性偏倚,本工作表明,与 MultiModN 相反,并行融合基线会错误地学习 MNAR,并在推断时面对不同 MNAR 模式时遭遇灾难性失败。据我们所知,这是首个天生抗 MNAR 的 MM 建模方法。总之,MultiModN 在不牺牲性能的前提下提供了细粒度洞察、鲁棒性与灵活性。
引用
@article{arxiv.2309.14118,
title = {MultiModN- Multimodal, Multi-Task, Interpretable Modular Networks},
author = {Vinitra Swamy and Malika Satayeva and Jibril Frej and Thierry Bossy and Thijs Vogels and Martin Jaggi and Tanja Käser and Mary-Anne Hartley},
journal= {arXiv preprint arXiv:2309.14118},
year = {2023}
}
备注
Accepted as a full paper at NeurIPS 2023 in New Orleans, USA