用于非模态补全的超变换器
计算机视觉与模式识别
2024-05-31 v1
摘要
非模态物体补全是一项复杂的任务,涉及根据可见部分和背景信息预测物体的不可见部分。学习形状先验对于有效的非模态补全至关重要,但传统方法通常依赖两阶段过程或额外信息,导致效率低下和潜在的错误累积。为了解决这些缺点,我们引入了一个名为超变换器非模态网络(H-TAN)的新框架。该框架利用配备动态卷积头的超变换器直接学习形状先验并准确预测非模态掩码。具体来说,H-TAN使用双分支结构从图像和掩码中提取多尺度特征。来自图像分支的多尺度特征引导超变换器学习形状先验并为每个实例生成动态卷积的权重。然后,动态卷积头使用来自掩码分支的特征来预测精确的非模态掩码。我们在三个基准数据集KINS、COCOA-cls和D2SA上广泛评估了我们的模型,H-TAN表现出优于现有方法的性能。额外的实验验证了我们框架中新型超变换器的有效性和稳定性。
引用
@article{arxiv.2405.19949,
title = {Hyper-Transformer for Amodal Completion},
author = {Jianxiong Gao and Xuelin Qian and Longfei Liang and Junwei Han and Yanwei Fu},
journal= {arXiv preprint arXiv:2405.19949},
year = {2024}
}