Text2Place:基于可 affordance 的文本引导的人类放置
计算机视觉与模式识别
2024-07-23 v1
摘要
对于给定场景,人类可以轻松推理出放置物体的合适位置和姿态。设计一种计算模型来推理这些可 affordance,具有挑战性,这反映了人类直观推理能力的水平。本工作针对给定背景场景中实现真实人类插入的问题,称为"语义人类放置"。在背景、尺度、姿态多样性以及最终人物身份保持等方面,这一任务极具挑战性。我们将问题分为两个阶段:\textbf{i)}利用文本引导学习\textit{语义掩码},用于在图像中定位放置人类的区域;\textbf{ii)} subject条件下的图像修复,将给定的主体置于\textit{语义掩码}内,遵循场景的可 affordance。为学习语义掩码,我们利用从文本到图像生成模型中学习到的丰富物体-场景先验知识,并优化一种新颖的参数化语义掩码,无需大规模训练。到目前为止,我们是首次提供一种有效解决方案,用于在多样化真实场景中实现真实的人类放置。该方法能够在保持背景和主体身份的同时,生成高度真实的场景构图。进一步,我们为几个下游任务提供结果——从单个或多个生成的人类进行场景幻觉以及文本基础的属性编辑。通过与强大的基线进行大量比较,我们展示了我们方法在真实人类放置方面的优势。
关键词
引用
@article{arxiv.2407.15446,
title = {Text2Place: Affordance-aware Text Guided Human Placement},
author = {Rishubh Parihar and Harsh Gupta and Sachidanand VS and R. Venkatesh Babu},
journal= {arXiv preprint arXiv:2407.15446},
year = {2024}
}
备注
ECCV 2024, Project Page: https://rishubhpar.github.io/Text2Place/