中文

AdaptaGen:基于层次化语义优化框架的数据集特定图像生成

计算机视觉与模式识别 2025-07-09 v1 多媒体

摘要

数据集特定图像生成旨在生成针对特定领域的高质量视觉内容,同时确保语义准确性和细节保真性。然而,现有方法存在两个关键局限性:首先,当前方法分别处理提示工程和模型适应,忽略了语义理解与视觉表征在特定领域内的内在依赖关系;其次,这些技术在内容合成过程中不充分地融入领域特定的语义约束,导致生成结果出现幻觉和语义偏差。为解决这些问题,我们提出了AdaptaGen——一种集成矩阵化提示优化与多视角理解的层次化语义优化框架,捕获从全局和局部两个角度的完整语义关系。为缓解特定领域中的幻觉问题,我们设计了一种跨模态适应机制,结合智能内容合成,既能保留核心主题元素,又能融合跨图像的多样化细节。此外,我们在生成阶段引入了两种阶段的标题语义转换。该方法在保持语义连贯性的同时增强视觉多样性,确保生成图像遵循领域特定约束。实验结果表明,我们的方法在40个类别中均取得优异性能,仅需每个类别16张图像,显著提升了图像质量、多样性和语义一致性。

关键词

引用

@article{arxiv.2507.05621,
  title  = {AdaptaGen: Domain-Specific Image Generation through Hierarchical Semantic Optimization Framework},
  author = {Suoxiang Zhang and Xiaxi Li and Hongrui Chang and Zhuoyan Hou and Guoxin Wu and Ronghua Ji},
  journal= {arXiv preprint arXiv:2507.05621},
  year   = {2025}
}