PixelBytes:用于多模态生成的统一表示
计算机视觉与模式识别
2024-10-22 v2 人工智能
摘要
本报告提出PixelBytes,一种用于统一多模态表示学习的方法。灵感来自序列模型如Image Transformers、PixelCNN和Mamba-Bytes,我们探索了将文本、音频、动作-状态和像素化图像(精灵)整合到 cohesive 表示中的方法。我们在PixelBytes Pokemon数据集和Optimal-Control数据集上进行了实验。我们的研究涵盖了各种模型架构,包括循环神经网络(RNN)、状态空间模型(SSM)和基于注意力的模型,着重于双向处理和我们的PxBy嵌入技术。我们根据数据压缩策略和自回归学习对模型进行评估,特别关注在预测和自回归模式下的长短期记忆(LSTM)网络。我们的结果表明,在此背景下,自回归模型优于预测模型。此外,我们发现扩散模型可用于控制问题并实现并行生成。PixelBytes旨为多模态数据处理和生成发展基础模型做出贡献。该项目的代码、模型和数据集均已在线提供。
引用
@article{arxiv.2410.01820,
title = {PixelBytes: Catching Unified Representation for Multimodal Generation},
author = {Fabien Furfaro},
journal= {arXiv preprint arXiv:2410.01820},
year = {2024}
}
备注
12 pages, 4 figures