用于并行拼接变分自编码器的多模态 Transformer
机器学习
2022-10-31 v1 人工智能
计算机视觉与模式识别
摘要
本文中,我们提出了一种使用并行拼接架构的多模态 transformer。我们不使用图像块(patches),而是将 R、G、B 通道中图像的列条带(column stripes)作为 transformer 的输入。列条带保留了原始图像的空间关系。我们将多模态 transformer 与变分自编码器结合,用于合成跨模态数据生成。该多模态 transformer 使用多个压缩矩阵设计,并作为并行拼接变分自编码器(PC-VAE)的编码器。PC-VAE 由多个编码器、一个潜空间和两个解码器组成。编码器基于随机高斯矩阵,不需要任何训练。我们提出了一种基于来自部分信息分解的交互信息的新损失函数。交互信息评估输入的跨模态信息和解码器输出。PC-VAE 通过最小化该损失函数进行训练。实验用于验证所提出的用于 PC-VAE 的多模态 transformer。
引用
@article{arxiv.2210.16174,
title = {Multimodal Transformer for Parallel Concatenated Variational Autoencoders},
author = {Stephen D. Liang and Jerry M. Mendel},
journal= {arXiv preprint arXiv:2210.16174},
year = {2022}
}
备注
NeurIPS 2022 Workshop on Vision Transformers: Theory and Application, New Orleans, LA, December 2022