基于 Stable Diffusion 的 AI 警局速写
计算机视觉与模式识别
2025-07-28 v1 人工智能
摘要
本项目旨在利用多模态 AI 方法自动化和增强嫌疑人速绘。开发并评估了三个管线:(1) 基准图像到图像 Stable Diffusion 模型,(2) 同一模型集成预训练 CLIP 模型用于文本-图像对齐,(3) 创新方法采用 LoRA 微调 CLIP 模型,应用于自注意力和交叉注意力层,并集成到 Stable Diffusion 中。消融研究确认,对文本描述与速绘之间的对齐效果,微调自注意力和交叉注意力层效果最佳。性能测试显示,Model 1 获得的最高结构相似性 (SSIM) 为 0.72 和峰值信噪比 (PSNR) 为 25 dB,超过 Model 2 和 Model 3。迭代细化提高了感知相似性 (LPIPS),其中 Model 3 在 Model 2 基础上有所改进,但仍落后于 Model 1。定性地,Model 1 生成的速绘显示出最清晰的面部特征,突显其作为基准模型尽管简单却具有鲁棒性。
引用
@article{arxiv.2507.18667,
title = {Gen-AI Police Sketches with Stable Diffusion},
author = {Nicholas Fidalgo and Aaron Contreras and Katherine Harvey and Johnny Ni},
journal= {arXiv preprint arXiv:2507.18667},
year = {2025}
}