Label2Label:一种用于多属性学习的语言建模框架
计算机视觉与模式识别
2022-07-19 v1
摘要
物体通常关联多个属性,且这些属性间常表现出高度相关性。对属性间复杂关系建模是多属性学习的一大挑战。本文提出一个简洁而通用的框架 Label2Label,以利用复杂的属性相关性。Label2Label 是从语言建模视角进行多属性预测的首次尝试。具体而言,它将每个属性标签视为描述样本的“词”。由于每个样本标注有多个属性标签,这些“词”会自然构成一个无序但有意义的“句子”,刻画相应样本的语义信息。受预训练语言模型在 NLP 中显著成功的启发,Label2Label 引入了一个图像条件掩码语言模型,该模型随机掩码掉标签“句子”中的部分“词”标记,并旨在基于被掩码的“句子”及图像特征所传达的上下文恢复它们。我们的直觉是:若神经网络能基于上下文与剩余属性提示推断缺失属性,则实例级属性关系已被充分掌握。Label2Label 概念简洁且实证强大。在不引入任务特定先验知识与高度专门化网络设计的情况下,与高度定制的领域专用方法相比,我们的方法在三个不同的多属性学习任务上取得了最先进(SOTA)结果。代码见 https://github.com/Li-Wanhua/Label2Label。
引用
@article{arxiv.2207.08677,
title = {Label2Label: A Language Modeling Framework for Multi-Attribute Learning},
author = {Wanhua Li and Zhexuan Cao and Jianjiang Feng and Jie Zhou and Jiwen Lu},
journal= {arXiv preprint arXiv:2207.08677},
year = {2022}
}
备注
ECCV 2022