中文

X-VILA:大型语言模型的跨模态对齐

计算机视觉与模式识别 2024-05-30 v1 计算与语言 机器学习

摘要

我们介绍 X-VILA,一个覆盖多模态的模型,旨在通过融合图像、视频和音频模态来扩展大型语言模型 (LLM) 的能力。通过将模态特定编码器与 LLM 输入对齐,并将扩散解码器与 LLM 输出对齐,X-VILA 实现了跨模态的理解、推理和生成。为促进这种跨模态对齐,我们构建了一个有效的交错式任意到任意模态指令跟随数据集。此外,我们确定了当前跨模态对齐方法的一个重大问题,即导致视觉信息丢失。为解决此问题,我们提出了一种带有视觉嵌入高速公路模块的视觉对齐机制。我们然后引入了训练 X-VILA 的一种资源高效配方,表现出在任意到任意模态对话中游行 Proficiency,显著超过了以前的方法。X-VILA 还在没有类似训练数据的情况下展现出跨模态的涌现属性。该项目将开源。

关键词

引用

@article{arxiv.2405.19335,
  title  = {X-VILA: Cross-Modality Alignment for Large Language Model},
  author = {Hanrong Ye and De-An Huang and Yao Lu and Zhiding Yu and Wei Ping and Andrew Tao and Jan Kautz and Song Han and Dan Xu and Pavlo Molchanov and Hongxu Yin},
  journal= {arXiv preprint arXiv:2405.19335},
  year   = {2024}
}

备注

Technical Report