中文

掩码扩散描述法用于视觉特征学习

计算机视觉与模式识别 2025-10-31 v1

摘要

我们通过对图像进行掩码处理来学习视觉特征。具体来说,利用基于视觉特征条件的掩码扩散语言模型对图像进行描述,这种称为掩码扩散描述法(Masked Diffusion Captioning, MDC)的表述方式。在训练过程中,对每张图像-描述文本对中的文本标记以随机比例进行掩码处理,然后训练一个以视觉特征为条件的解码器以恢复原始文本。训练完成后,所学习的视觉特征可应用于下游视觉任务。与自回归描述方法相比,MDC中视觉学习信号的强度不依赖于每个标记在序列中的位置,从而降低了对额外目标函数的需求。跨多种学术规模模型和数据集的线性探针实验表明,所学习的视觉特征与自回归和对比方法所产出的特征相当。

关键词

引用

@article{arxiv.2510.26799,
  title  = {Masked Diffusion Captioning for Visual Feature Learning},
  author = {Chao Feng and Zihao Wei and Andrew Owens},
  journal= {arXiv preprint arXiv:2510.26799},
  year   = {2025}
}

备注

EMNLP 2025 (Findings). Project page: https://cfeng16.github.io/mdlm4vfl/