中文

定位、理解、协作:通过意图推理器实现语义感知的拖拽编辑

计算机视觉与模式识别 2024-10-23 v2

摘要

灵活且准确的基于拖拽的编辑是一项具有挑战性的任务,最近引起了广泛关注。当前方法通常通过点拖拽将这个问题建模为自动学习“如何拖拽”,并且通常产生一个确定性的估计,这带来了两个关键限制:1)忽略了基于拖拽的编辑固有的不适定性,其中多个结果可能对应于一个给定的输入,如图1所示;2)忽略了图像质量的约束,可能导致意外的失真。为了缓解这个问题,我们提出了LucidDrag,它将焦点从“如何拖拽”转向“什么-然后-如何”的范式。LucidDrag包含一个意图推理器和一个协作引导采样机制。前者推断出几个最优的编辑策略,确定要编辑什么内容以及什么语义方向。基于前者,后者通过将现有的编辑引导与新提出的语义引导和质量引导协作集成来解决“如何拖拽”的问题。具体来说,语义引导是通过基于推理出的意图建立语义编辑方向来获得的,而质量引导是通过使用图像保真度判别器的分类器引导来实现的。定性和定量比较都证明了LucidDrag相对于先前方法的优越性。

关键词

引用

@article{arxiv.2406.00432,
  title  = {Localize, Understand, Collaborate: Semantic-Aware Dragging via Intention Reasoner},
  author = {Xing Cui and Peipei Li and Zekun Li and Xuannan Liu and Yueying Zou and Zhaofeng He},
  journal= {arXiv preprint arXiv:2406.00432},
  year   = {2024}
}

备注

Accepted by NeurIPS 2024