轨迹与视觉模态在动词表征中的比较
计算机视觉与模式识别
2023-03-23 v1 人工智能
计算与语言
摘要
三维轨迹(即物体随时间的 3D 位置与旋转)已被证明编码了动词语义的关键方面(例如 roll 与 slide 的含义)。然而,NLP 中的大多数多模态模型使用 2D 图像作为对世界的表征。鉴于 3D 空间在动词语义形式化模型中的重要性,我们预期这些 2D 图像会导致表征贫乏,无法捕捉意义中的细微差异。本文在受控实验中直接检验该假设。我们训练自监督的图像与轨迹编码器,然后评估它们各自学习区分动词概念的程度。与我们的初始预期相反,我们发现 2D 视觉模态的表现与 3D 轨迹相近。尽管该问题尚需进一步研究,我们的初步发现挑战了“更丰富的环境表征必然转化为更好的语言表征学习”这一传统观点。
引用
@article{arxiv.2303.12737,
title = {Comparing Trajectory and Vision Modalities for Verb Representation},
author = {Dylan Ebert and Chen Sun and Ellie Pavlick},
journal= {arXiv preprint arXiv:2303.12737},
year = {2023}
}
备注
4 pages, 1 figure