中文

SketchTriplet:基于自监督的场景草图-文本-图像三元组生成

计算机视觉与模式识别 2024-05-30 v1

摘要

免费手绘草图的稀缺性 presents 挑战性问题。尽管已涌现出一些大规模草图数据集,但这些数据集主要由单对象级别的草图组成。对于场景草图,仍缺乏大规模的配对数据集。本文提出一种无需依赖现有场景草图的自监督场景草图生成方法,实现将单对象草图转换为场景草图。为此,我们引入了向量草图标题生成和草图语义扩展的方法。此外,我们设计了一个集成多模态感知约束的草图生成网络,适用于零样本图像到草图下游任务,实验验证显示其表现优异。最后,利用我们提议的草图到草图生成方法,我们贡献了一个以场景草图为中心的大规模数据集,包含高度语义一致的“文本-草图-图像”三元组。我们的研究表明,该数据集可以显著提升现有模型在草图图像检索和草图控制图像合成任务中的能力。我们将公开提供该数据集和代码。

关键词

引用

@article{arxiv.2405.18801,
  title  = {SketchTriplet: Self-Supervised Scenarized Sketch-Text-Image Triplet Generation},
  author = {Zhenbei Wu and Qiang Wang and Jie Yang},
  journal= {arXiv preprint arXiv:2405.18801},
  year   = {2024}
}