中文

基于跨模态语义挖掘的目标分割

计算机视觉与模式识别 2023-08-08 v3

摘要

多传感器线索在目标分割中已展现出潜力,但各传感器固有的噪声以及实际中的标定误差可能使分割精度偏离。本文提出一种新方法,通过挖掘跨模态语义(Cross-Modal Semantics)来引导多模态特征的融合与解码,旨在基于相对熵控制模态贡献。我们从两方面探究多模态输入间的语义:模态间共享一致性与模态特定差异性。具体地,我们提出一种称为XMSNet的新网络,包含(1)全方位注意力融合(AF)、(2)由粗到细解码器(CFD)与(3)跨层自监督。一方面,AF模块显式解耦共享与特定表示,并根据质量通过学习调整模态贡献的\textit{比例、区域}与\textit{模式}来加权。另一方面,我们的CFD先解码共享特征,再通过感知特异性的查询细化输出。此外,我们强制解码层间的语义一致性以实现网络层级间的交互,提升特征判别力。在十一个含深度或热成像线索的数据集上,以及显著性目标分割与伪装目标分割两个挑战性任务上的详尽对比,验证了我们在性能与鲁棒性上的有效性。源代码公开于 https://github.com/Zongwei97/XMSNet。

关键词

引用

@article{arxiv.2305.10469,
  title  = {Object Segmentation by Mining Cross-Modal Semantics},
  author = {Zongwei Wu and Jingjing Wang and Zhuyun Zhou and Zhaochong An and Qiuping Jiang and Cédric Demonceaux and Guolei Sun and Radu Timofte},
  journal= {arXiv preprint arXiv:2305.10469},
  year   = {2023}
}

备注

ACM MM 2023