神经驱动的图像编辑
计算机视觉与模式识别
2026-01-12 v3
摘要
传统图像编辑通常依赖手动提示,这使得其耗费大量人力,且对于运动控制或语言能力有限的个体而言难以使用。借助脑机接口(BCI)和生成式模型的最新进展,我们提出了 LoongX,一种由多模态神经生理信号驱动的免手动图像编辑方法。LoongX 利用最先进的扩散模型,该模型在包含 23,928 对图像编辑对的综合数据集上进行训练,每对均与捕捉用户意图的同步脑电图(EEG)、功能性近红外光谱(fNIRS)、光电容积脉搏波(PPG)和头部运动信号配对。为有效解决这些信号的异构性问题,LoongX 集成了两个关键模块。跨尺度状态空间(CS3)模块编码具有信息量的特定模态特征。动态门控融合(DGF)模块进一步将这些特征聚合到统一的潜在空间中,随后通过对扩散 Transformer(DiT)进行微调,使其与编辑语义对齐。此外,我们使用对比学习预训练编码器,以将认知状态与来自嵌入式自然语言的语义意图对齐。大量实验表明,LoongX 取得了与文本驱动方法相当的性能(CLIP-I:0.6605 vs. 0.6558;DINO:0.4812 vs. 0.4636),并且在将神经信号与语音结合时优于后者(CLIP-T:0.2588 vs. 0.2549)。这些结果突出了神经驱动的生成式模型在实现无障碍、直观图像编辑方面的潜力,并为认知驱动的创意技术开辟了新方向。代码和数据集已在项目网站发布:https://loongx1.github.io。
引用
@article{arxiv.2507.05397,
title = {Neural-Driven Image Editing},
author = {Pengfei Zhou and Jie Xia and Xiaopeng Peng and Wangbo Zhao and Zilong Ye and Zekai Li and Suorong Yang and Jiadong Pan and Yuanxiang Chen and Ziqiao Wang and Kai Wang and Qian Zheng and Hao Jin and Xiaojun Chang and Gang Pan and Shurong Dong and Kaipeng Zhang and Yang You},
journal= {arXiv preprint arXiv:2507.05397},
year = {2026}
}
备注
22 pages, 14 figures