中文

指代层分解

计算机视觉与模式识别 2026-02-24 v1

摘要

精确、对象感知的视觉内容控制对于高级图像编辑和构图生成至关重要。然而,大多数现有方法是整体性地作用于整个图像,这限制了对单个场景元素进行隔离和操作的能力。相比之下,分层表示将场景明确地分解为对象、环境上下文和视觉效果,提供了更直观且结构化的框架,用于解释和编辑视觉内容。为弥合这一差距并实现构图理解和可控编辑,我们提出了指代层分解(Referring Layer Decomposition, RLD)任务,该任务从单个 RGB 图像中预测完整的 RGBA 图层,条件受灵活用户提示的制约,如空间输入(例如点、框、掩码)、自然语言描述或其组合。其核心是 RefLade 数据集,包含 111 万张图像-图层-提示三元组,由可扩展的数据引擎生成,以及 10 万张人工精选的高保真图层。配合以感知为基础、以人类偏好为导向的自动评估协议,RefLade 将 RLD 确立为一个明确且可基准化的研究任务。基于此基础,我们提出了 RefLayer,即一个为提示条件图层分解而设计的简单基线,实现了高质量的视觉保真度和语义对齐。大量实验表明,我们的方法能够有效训练、可靠评估和高质量图像分解,同时表现出强大的零样本泛化能力。

关键词

引用

@article{arxiv.2602.19358,
  title  = {Referring Layer Decomposition},
  author = {Fangyi Chen and Yaojie Shen and Lu Xu and Ye Yuan and Shu Zhang and Yulei Niu and Longyin Wen},
  journal= {arXiv preprint arXiv:2602.19358},
  year   = {2026}
}

备注

ICLR 2026