中文

BrainDreamer:基于语言引导从脑电信号进行推理连贯且可控的图像生成

计算机视觉与模式识别 2024-09-24 v1 人工智能

摘要

我们能否直接将大脑中想象的内容与我们的描述一起可视化?人类感知的内在本质表明,当我们在思考时,身体能够结合语言描述并在大脑中构建出生动的画面。直观上,生成模型也应具备这种多功能性。本文提出 BrainDreamer,一种新颖的端到端语言引导生成框架,能够模拟人类推理并从脑电(EEG)信号生成高质量图像。我们的方法优势在于能够消除非侵入式 EEG 数据采集引入的噪声,同时实现 EEG 与图像模态之间更精确的映射,从而生成质量显著更好的图像。具体而言,BrainDreamer 包含两个关键学习阶段:1)模态对齐和 2)图像生成。在对齐阶段,我们提出一种新颖的基于掩码的三重对比学习策略,以有效对齐 EEG、文本和图像嵌入,从而学习统一的表示。在生成阶段,我们通过设计可学习的 EEG 适配器,将 EEG 嵌入注入预训练的 Stable Diffusion 模型,以生成高质量的推理连贯图像。此外,BrainDreamer 可以接受文本描述(例如颜色、位置等)以实现可控的图像生成。大量实验表明,我们的方法在生成质量和定量性能方面均显著优于现有方法。

关键词

引用

@article{arxiv.2409.14021,
  title  = {BrainDreamer: Reasoning-Coherent and Controllable Image Generation from EEG Brain Signals via Language Guidance},
  author = {Ling Wang and Chen Wu and Lin Wang},
  journal= {arXiv preprint arXiv:2409.14021},
  year   = {2024}
}