用于多模态学习的神经启发信息论分层感知
机器学习
2024-04-24 v2
摘要
在自主系统和信息物理系统中,整合和处理来自各种来源或模态的信息对于获得对真实世界的全面准确感知至关重要。受神经科学启发,我们开发了信息论分层感知 (ITHP) 模型,该模型利用了信息瓶颈的概念。与大多数在神经网络中同等整合所有模态的传统融合模型不同,我们的模型指定了一个主模态,并将其余模态视为信息通路中的检测器,用于提炼信息流。我们提出的感知模型旨在通过在最小化潜状态与输入模态状态之间的互信息和最大化潜状态与其余模态状态之间的互信息之间取得平衡,来构建有效且紧凑的信息流。这种方法产生了紧凑的潜状态表示,这些表示保留了相关信息同时最小化了冗余,从而大幅增强了多模态表示学习的性能。在MUStARD、CMU-MOSI和CMU-MOSEI数据集上的实验评估表明,我们的模型在多模态学习场景中始终能提炼出关键信息,优于SOTA基准。值得注意的是,在CMU-MOSI数据集上,ITHP在多模态情感二分类任务的所有评估指标(即二值准确率、F1分数、平均绝对误差和Pearson相关系数)上均超越了人类水平的表现。
引用
@article{arxiv.2404.09403,
title = {Neuro-Inspired Information-Theoretic Hierarchical Perception for Multimodal Learning},
author = {Xiongye Xiao and Gengshuo Liu and Gaurav Gupta and Defu Cao and Shixuan Li and Yaxing Li and Tianqing Fang and Mingxi Cheng and Paul Bogdan},
journal= {arXiv preprint arXiv:2404.09403},
year = {2024}
}
备注
Accepted by ICLR 2024. Camera Ready Version