PixelBytes:捕获多模态生成的统一嵌入
计算机视觉与模式识别
2024-10-23 v2 人工智能
摘要
本报告介绍了 PixelBytes 嵌入,这是一种用于统一多模态表征学习的新方法。我们的 метод通过单一、一致的表征捕获多样化输入,实现了多模态序列生成的涌现特性,尤其是针对文本和像素化图像。灵感来自图像转换器、PixelCNN 和 Mamba-Bytes 等前沿序列模型,PixelBytes 旨在解决集成不同数据类型的挑战。我们探索了各种模型架构,包括循环神经网络 (RNN)、状态空间模型 (SSM) 和注意力模型,关注双向处理和我们创新的 PxBy 嵌入技术。在针对专用 PixelBytes 宝可梦数据集进行的实验中,证明了采用 PxBy 嵌入和卷积层的双向序列模型能够生成连贯的多模态序列。本工作推动了能够统一理解和生成多模态数据的集成 AI 模型的发展。
关键词
引用
@article{arxiv.2409.15512,
title = {PixelBytes: Catching Unified Embedding for Multimodal Generation},
author = {Fabien Furfaro},
journal= {arXiv preprint arXiv:2409.15512},
year = {2024}
}
备注
This article is an earlier version of my work arXiv:2410.01820 "PixelBytes: Catching Unified Representation for Multimodal Generation."