面向文本监督的体姿感知语义分割中的认知迁移与解耦
计算机视觉与模式识别
2024-12-30 v2
摘要
本文探讨了一种新颖的文本监督体姿感知语义分割(Text-supervised Egocentric Semantic Segmentation, TESS)任务,旨在通过图像级别标签中的文本信息,为体姿感知图像的像素级类别分配。该任务具有巨大的发展潜力,由于体姿场景包含稠密的佩戴者-物体关系和物体间干扰。然而,大多数最近的第三人称视角方法利用冻结的对比语言-图像预训练(Contrastive Language-Image Pre-training, CLIP)模型,而CLIP模型是在语义导向的第三人称数据上预训练的,对于体姿视角缺乏适应性,存在“关系不敏感”问题。因此,我们提出了一种认知迁移与解耦网络(Cognition Transferring and Decoupling Network, CTDN),其首先通过关联图像和文本学习体姿佩戴者-物体关系。此外,发展了认知迁移模块(Cognition Transferring Module, CTM),用于从大规模预训练模型中蒸馏认知知识,以识别具有不同语义的体姿物体。基于迁移后的认知,前景-背景解耦模块(Foreground-background Decoupling Module, FDM)将视觉表征解耦,显式区分前景和背景区域,以缓解体姿关系学习中由前景-背景干扰性物体导致的误激活区域。在四个TESS基准测试上的大量实验表明,我们方法的有效性,显著优于许多最近相关方法。代码将在 https://github.com/ZhaofengSHI/CTDN 提供。
引用
@article{arxiv.2410.01341,
title = {Cognition Transferring and Decoupling for Text-supervised Egocentric Semantic Segmentation},
author = {Zhaofeng Shi and Heqian Qiu and Lanxiao Wang and Fanman Meng and Qingbo Wu and Hongliang Li},
journal= {arXiv preprint arXiv:2410.01341},
year = {2024}
}
备注
Accepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)