X-Trans2Cap:基于Transformer的跨模态知识迁移用于三维稠密描述
计算机视觉与模式识别
2022-04-07 v3
摘要
三维稠密描述旨在用自然语言描述三维场景中的各个物体,其中三维场景通常表示为RGB-D扫描或点云。然而,仅利用单一模态信息(例如点云)的先前方法无法生成忠实的描述。尽管将二维特征聚合到点云中可能有益,但这会引入额外的计算负担,尤其是在推理阶段。在本研究中,我们探索了一种基于Transformer的跨模态知识迁移方法用于三维稠密描述,即X-Trans2Cap,通过使用教师-学生框架的知识蒸馏,有效提升单模态三维描述的性能。具体而言,在训练阶段,教师网络利用辅助的二维模态,并通过特征一致性约束来指导学生网络,该学生网络仅以点云作为输入。得益于精心设计的跨模态特征融合模块和训练阶段的特征对齐,X-Trans2Cap轻松获取了嵌入在二维图像中的丰富外观信息。因此,在推理阶段仅使用点云即可生成更忠实的描述。定性和定量结果证实,X-Trans2Cap大幅优于先前的最先进技术,即在ScanRefer和Nr3D数据集上,绝对CIDEr分数分别提高了约21分和约16分。
引用
@article{arxiv.2203.00843,
title = {X-Trans2Cap: Cross-Modal Knowledge Transfer using Transformer for 3D Dense Captioning},
author = {Zhihao Yuan and Xu Yan and Yinghong Liao and Yao Guo and Guanbin Li and Zhen Li and Shuguang Cui},
journal= {arXiv preprint arXiv:2203.00843},
year = {2022}
}
备注
To appear in CVPR2022