中文

DECap:基于扩散机制迈向广义显式描述编辑

计算机视觉与模式识别 2024-03-07 v2

摘要

显式描述编辑(ECE)——通过一系列显式编辑操作(如KEEP、DELETE)精炼参考图像描述——因其可解释与类人特性而备受关注。在经过精心设计的参考与真值描述对训练后,最先进的ECE模型在原始训练数据分布之外泛化能力有限,即仅能精炼同分布样本中的内容细节,却无法纠正分布外样本中的错误。为此,我们提出一种基于扩散的显式描述编辑方法:DECap。具体而言,我们将ECE任务重构为扩散机制下的去噪过程,并引入创新的基于编辑的加噪与去噪过程。得益于该设计,加噪过程通过直接引入词级噪声进行训练、学习输入参考描述的多样分布,从而消除对精细配对数据筛选的需求。去噪过程涉及对编辑操作及对应内容词的显式预测,通过迭代逐步编辑精炼参考描述。为更高效实现扩散过程并提升推理速度,DECap摒弃流行的多阶段设计,直接同时生成编辑操作与内容词。大量消融实验证明了DECap在各场景下的强泛化能力。更有趣的是,其在提升描述生成质量与可控性方面也展现出巨大潜力。

关键词

引用

@article{arxiv.2311.14920,
  title  = {DECap: Towards Generalized Explicit Caption Editing via Diffusion Mechanism},
  author = {Zhen Wang and Xinyun Jiang and Jun Xiao and Tao Chen and Long Chen},
  journal= {arXiv preprint arXiv:2311.14920},
  year   = {2024}
}