生成内容丰富化
计算机视觉与模式识别
2024-10-10 v3 机器学习
摘要
本文探讨了一种新颖的人工智能生成任务,称为生成内容丰富化(GCE)。传统的 AI 内容生成通过隐式地基于有限的语义描述来丰富给定的文本描述,以产生视觉上逼真的内容。与此不同,我们提出的 GCE 旨在在视觉和文本域显式地执行内容丰富化。目标是生成视觉上逼真、结构连贯且语义丰富的内容。为解决 GCE,我们提出了一种深度端到端对抗方法,显式地在丰富过程中探索语义及语义之间的关系。我们的 approach 首先将输入描述建模为场景图,其中节点表示对象,边捕获对象之间的关系。我们然后在输入场景描述之上采用图卷积网络来预测额外丰富的对象及其与现有对象的关系。最后,将丰富后的描述传递给图像合成模型以生成相应的视觉内容。在 Visual Genome 数据集上进行的实验表明,我们的方法有效,产生了有前景且视觉上合理的结果。
关键词
引用
@article{arxiv.2405.03650,
title = {Generated Contents Enrichment},
author = {Mahdi Naseri and Jiayan Qiu and Zhou Wang},
journal= {arXiv preprint arXiv:2405.03650},
year = {2024}
}