中文

面向3D物体的多任务领域适应语言 grounding

计算机视觉与模式识别 2024-07-08 v2

摘要

现有针对3D物体的语言 grounding 研究大多聚焦于利用即插即用的预训练模型捕获特征,如视点选择或几何先验。然而,这些方法未能探索跨域环境中语言-视觉对齐的跨模态表征。为此,我们提出一种新方法,称为Domain Adaptation for Language Grounding (DA4LG),具体用于3D物体。具体而言,提出的DA4LG包含一个集成多任务学习的视觉适配器模块,以全面多模态特征表征实现视觉-语言对齐。实验结果表明,DA4LG在视觉和非视觉语言描述方面均表现出竞争性能,独立于观察完整性。DA4LG在单视角和多视角设置下分别在SNARE语言 grounding 基准中实现了83.8%和86.8%的准确率。仿真实验表明,DA4LG相较于现有方法表现出良好的实用性和普适性。我们的项目地址:https://sites.google.com/view/da4lg

关键词

引用

@article{arxiv.2407.02846,
  title  = {Multi-Task Domain Adaptation for Language Grounding with 3D Objects},
  author = {Penglei Sun and Yaoxian Song and Xinglin Pan and Peijie Dong and Xiaofei Yang and Qiang Wang and Zhixu Li and Tiefeng Li and Xiaowen Chu},
  journal= {arXiv preprint arXiv:2407.02846},
  year   = {2024}
}