中文

面向情境感知对象放置与赞助标志集成的智能场景增强

计算机视觉与模式识别 2025-12-29 v1

摘要

智能图像编辑日益依赖于计算机视觉、多模态推理和生成模型的进步。尽管视觉语言模型 (VLM) 和扩散模型能够实现引导式视觉操作,但现有工作很少确保插入的对象在情境上是恰当的。我们引入两个新的广告和数字媒体任务:(1) 情境感知对象插入,需要预测合适的对象类别、生成它们并在场景中对其进行合理放置;(2) 赞助产品标志增强,涉及检测产品并插入正确的品牌标志,即使项目未标记或标记不正确。为支持这些任务,我们构建了两个新的带有类别注释、放置区域和赞助产品标签的数据集。

关键词

引用

@article{arxiv.2512.21560,
  title  = {Toward Intelligent Scene Augmentation for Context-Aware Object Placement and Sponsor-Logo Integration},
  author = {Unnati Saraswat and Tarun Rao and Namah Gupta and Shweta Swami and Shikhar Sharma and Prateek Narang and Dhruv Kumar},
  journal= {arXiv preprint arXiv:2512.21560},
  year   = {2025}
}