多模态变分自编码器基准测试:CdSprites+ 数据集与工具包
机器学习
2024-09-18 v3
摘要
多模态变分自编码器(VAEs)近年来成为 intensively 研究的对象,因为它们能将多种模态整合进联合表示,从而可作为数据分类与生成的有力工具。迄今已提出若干多模态 VAE 学习方法,然而它们的比较与评估颇不一致。原因之一在于模型在实现层面存在差异,另一问题在于这些情形下常用的数据集并非最初为评估多模态生成模型而设计。本文解决上述两方面问题。首先,我们提出一个用于系统性多模态 VAE 训练与比较的工具包。该工具包目前包含 4 种现有多模态 VAE 与 6 个常用基准数据集,并附有如何轻松添加新模型或新数据集的说明。其次,我们提出一个解耦双模态数据集,旨在跨多个难度层级全面评估联合生成与交叉生成能力。我们通过比较所实现的最先进模型展示了该数据集的效用。
引用
@article{arxiv.2209.03048,
title = {Benchmarking Multimodal Variational Autoencoders: CdSprites+ Dataset and Toolkit},
author = {Gabriela Sejnova and Michal Vavrecka and Karla Stepanova and Tadahiro Taniguchi},
journal= {arXiv preprint arXiv:2209.03048},
year = {2024}
}