3D 视觉-语言模型能否真正理解自然语言?
计算机视觉与模式识别
2024-07-04 v3
摘要
3D 视觉-语言(3D-VL)任务的快速进展为人类使用自然语言与具身智能体或机器人交互开辟了新途径。尽管取得了这些进展,我们发现了一个显著的局限性:现有的 3D-VL 模型对语言输入的风格表现出敏感性,在理解语义相同但以不同变体书写的句子时存在困难。这一观察引出了一个关键问题:3D 视觉-语言模型能否真正理解自然语言?为了测试 3D-VL 模型的语言可理解性,我们首先提出了一项语言鲁棒性任务,用于在各种任务中系统评估 3D-VL 模型,并对其在不同语言风格变体下的性能进行基准测试。重要的是,考虑到人类语言的多样性和不可预测性,这些变体在需要与人类直接交互的应用中很常见,例如具身机器人技术。我们提出了一个 3D 语言鲁棒性数据集,基于人类语言的特征设计,以促进对鲁棒性的系统研究。我们的综合评估揭示了所有现有模型在各种 3D-VL 任务中的性能均出现显著下降。即使是最先进的 3D-LLM 也无法理解相同句子的某些变体。进一步的深入分析表明,现有模型具有脆弱且有偏的融合模块,这源于现有数据集的低多样性。最后,我们提出了一个由 LLM 驱动的免训练模块,以提高语言鲁棒性。数据集和代码将在 github 上提供。
引用
@article{arxiv.2403.14760,
title = {Can 3D Vision-Language Models Truly Understand Natural Language?},
author = {Weipeng Deng and Jihan Yang and Runyu Ding and Jiahui Liu and Yijiang Li and Xiaojuan Qi and Edith Ngai},
journal= {arXiv preprint arXiv:2403.14760},
year = {2024}
}
备注
https://github.com/VincentDENGP/3D-LR