面向 Gemini 3 Pro Image 的 SCHEMA: 受控 AI 图像生成的方法论
计算机视觉与模式识别
2026-02-24 v1 人机交互
摘要
本文提出 SCHEMA(Structured Components for Harmonized Engineered Modular Architecture),一种为 Google Gemini 3 Pro Image 设计的结构化提示工程方法论。不同于通用提示指南或模型中性技巧,SCHEMA 是建立在系统化专业实践之上的工程化框架,涵盖约 850 个经验证的 API 预测,估计生成约 4800 张图像,跨越六个专业领域: 房地产摄影、商业产品摄影、编辑内容、分镜、商业活动和信息设计。该方法引入三级递进系统(BASE、MEDIO、AVANZATO),从探索性(约 5%)到指令性(约 95%)逐步提升实践者控制力;模块化标签架构包含 7 个核心和 5 个可选结构化组件;决策树附带明确的路由规则指向备用工具;并系统性记录模型局限性及相应解决方案。关键发现包括:在 621 个结构化提示中,91% 的强制性要求符合率和 94% 的禁用性要求符合率;对比批处理一致性测试显示,结构化提示在跨生成一致性方面显著优于非结构化提示;独立实践者验证(n=40)表明方法具有良好实用性;专门的信息设计验证显示,在约 300 个可公开验证的图表中,空间和排版控制的首次生成符合率超过 95%。此前已在 Zenodo 上发布(doi:10.5281/zenodo.18721380)。
关键词
引用
@article{arxiv.2602.18903,
title = {SCHEMA for Gemini 3 Pro Image: A Structured Methodology for Controlled AI Image Generation on Google's Native Multimodal Model},
author = {Luca Cazzaniga},
journal= {arXiv preprint arXiv:2602.18903},
year = {2026}
}
备注
24 pages, 8 tables. Based on SCHEMA Method v1.0 (deposited December 11, 2025). Previously published on Zenodo: doi:10.5281/zenodo.18721380