CogBlender:面向文本到图像生成的连续认知干预
计算机视觉与模式识别
2026-05-19 v2
摘要
除了传递语义信息之外,图像还具备认知属性,可引发观众特定的心理反应,如记忆编码或情感反应。虽然现代文本到图像(T2I)模型有效地生成语义连贯的内容,但它们在控制认知属性(如价值、可记忆性)方面存在挑战,常常无法对齐用户的心理意图。为弥合这一差距,我们引入CogBlender,通过一种新颖的两阶段方法实现对认知属性的连续且多维度干预。首先,我们构建离散认知感知的重写提示-输入提示的变体,代表不同的极端认知状态。其次,我们将这些离散提示转换为连续控制信号,通过在流匹配模型的速度场域中进行插值。通过根据目标认知分数动态混合来自这些提示预测的速度场,CogBlender平滑地引导生成轨迹,以实现最终图像中所需的认知属性。广泛的实验在四个认知属性(即价值、唤起、支配和可记忆性)上表明,CogBlender实现了有效的认知干预。
引用
@article{arxiv.2603.09286,
title = {CogBlender: Towards Continuous Cognitive Intervention in Text-to-Image Generation},
author = {Shengqi Dang and Yi He and Jiaying Lei and Ziqing Qian and Nan Cao},
journal= {arXiv preprint arXiv:2603.09286},
year = {2026}
}