中文

注意力 VQ-VAE

计算机视觉与模式识别 2024-02-12 v2 人工智能

摘要

我们提出一种通过集成残差编码器与残差像素注意力层来增强 VQ-VAE 模型能力的新方法,称为注意力残差编码器(AREN)。我们研究的目标是在保持实用参数规模的同时提升 VQ-VAE 的性能。AREN 编码器被设计为可在多个层级有效运作,以适应不同的架构复杂度。关键创新在于将像素间自注意力机制集成到 AREN 编码器中。该方法使我们能够高效捕获并利用潜向量间的上下文信息。此外,我们的模型使用额外的编码层级以进一步增强模型的表征能力。我们的注意力层采用极小参数方法,确保仅当来自其他像素的相关信息可用时潜向量才被修改。实验结果表明,我们所提出的改进显著提升了数据表征与生成能力,使 VQ-VAE 如所述更适用于广泛应用。

关键词

引用

@article{arxiv.2309.11641,
  title  = {Attentive VQ-VAE},
  author = {Angello Hoyos and Mariano Rivera},
  journal= {arXiv preprint arXiv:2309.11641},
  year   = {2024}
}

备注

5 pages, 4 figures, 2 table2, 1 pseudo-code