基于病灶聚焦向量自回归模型的可控皮肤合成
计算机视觉与模式识别
2025-08-28 v1
摘要
真实临床实践中的皮肤图像通常有限,导致深度学习模型的训练数据短缺。虽然许多研究探索了皮肤图像合成,但现有方法通常生成低质量图像,并且缺乏对病灶位置和类型的控制。为了解决这些局限性,我们提出了 LF-VAR,一个利用量化病灶测量分数和病灶类型标签来指导临床相关且可控的皮肤图像合成的模型。它能够基于语言提示生成具有特定病灶特征的可控皮肤图像。我们训练了一个多尺度病灶聚焦向量量化变分自编码器 (VQVAE),将图像编码为离散潜在表示以进行结构化标记化。然后,在标记化表示上训练的视觉自回归 (VAR) Transformer 促进了图像合成。来自病灶区域的病灶测量和类型作为条件嵌入被整合以增强合成保真度。我们的方法在七种病灶类型中取得了最佳总体 FID 分数 (平均 0.74),将之前的最先进水平 (SOTA) 提高了 6.3%。本研究强调了我们可控皮肤合成模型在生成高保真度、临床相关的合成皮肤图像方面的有效性。我们的框架代码可在 https://github.com/echosun1996/LF-VAR 获取。
引用
@article{arxiv.2508.19626,
title = {Controllable Skin Synthesis via Lesion-Focused Vector Autoregression Model},
author = {Jiajun Sun and Zhen Yu and Siyuan Yan and Jason J. Ong and Zongyuan Ge and Lei Zhang},
journal= {arXiv preprint arXiv:2508.19626},
year = {2025}
}
备注
11 pages, 4 figures