脑条件多模态合成:综述与分类
人工智能
2024-01-04 v2
摘要
在人工智能生成内容(AIGC)时代,条件多模态合成技术(如文本到图像、文本到视频、文本到音频等)正在逐渐重塑现实世界中的自然内容。多模态合成技术的关键在于建立不同模态之间的映射关系。脑信号作为大脑如何解释外部信息的潜在反映,与各种外部模态呈现出独特的一对多对应关系。这种对应关系使得脑信号成为多模态内容合成的一个有前景的引导条件。脑条件多模态合成是指将脑信号解码回感知体验,这对于开发实用的脑机接口系统和揭示大脑如何感知和理解外部刺激的复杂机制至关重要。本综述全面考察了基于AIGC的脑条件多模态合成这一新兴领域,称为AIGC-Brain,以描绘当前格局和未来方向。首先,介绍了相关的脑神经影像数据集、功能性脑区和主流生成模型,作为AIGC-Brain解码和分析的基础。接下来,我们提供了AIGC-Brain解码模型的全面分类,并介绍了特定任务的代表性工作和详细的实现策略,以促进比较和深入分析。然后介绍了质量评估方法,用于定性和定量评估。最后,本综述探讨了获得的见解,提出了当前挑战并概述了AIGC-Brain的前景。作为该领域的首篇综述,本文为AIGC-Brain研究的进展铺平了道路,提供了基础性概述以指导未来工作。
引用
@article{arxiv.2401.00430,
title = {Brain-Conditional Multimodal Synthesis: A Survey and Taxonomy},
author = {Weijian Mai and Jian Zhang and Pengfei Fang and Zhijun Zhang},
journal= {arXiv preprint arXiv:2401.00430},
year = {2024}
}