中文

Cerberus Transformer:联合语义、可供性与属性解析

计算机视觉与模式识别 2022-03-31 v2

摘要

多任务室内场景理解被广泛认为是一种引人入胜的表述形式,因为不同任务之间的亲和性可能带来性能提升。在本文中,我们解决了联合语义、可供性与属性解析这一新问题。然而,成功解决它需要一个模型能够捕获长距离依赖关系、从弱对齐数据中学习,并在训练期间适当平衡子任务。为此,我们提出了一种名为 Cerberus 的基于注意力的架构和一个定制的训练框架。我们的方法有效应对了上述挑战,并在所有三项任务上均达到了最先进的性能。此外,深入分析显示了与人类认知一致的概念亲和性,这启发我们探索弱监督学习的可能性。令人惊讶的是,Cerberus 仅使用 0.1%-1% 的标注就取得了优异的结果。可视化进一步证实,这一成功归功于跨任务的共同注意力图。代码和模型可在 https://github.com/OPEN-AIR-SUN/Cerberus 获取。

关键词

引用

@article{arxiv.2111.12608,
  title  = {Cerberus Transformer: Joint Semantic, Affordance and Attribute Parsing},
  author = {Xiaoxue Chen and Tianyu Liu and Hao Zhao and Guyue Zhou and Ya-Qin Zhang},
  journal= {arXiv preprint arXiv:2111.12608},
  year   = {2022}
}

备注

Accepted to CVPR 2022. code: https://github.com/OPEN-AIR-SUN/Cerberus