中文

数值回归能否被语言模型超越?基于语言的多模态轨迹预测

计算与语言 2024-03-28 v1 计算机视觉与模式识别 机器学习 机器人学

摘要

语言模型在上下文理解和生成方面展现出惊人的能力。鼓舞人心的是近期语言基础模型的成功,本文提出LMTraj(Language-based Multimodal Trajectory predictor),将轨迹预测任务重新诠释为一种问答问题。 departing from传统的数值回归模型,该方法将轨迹坐标序列视为离散信号,如文本提示一样。具体而言,我们首先将输入空间中的轨迹坐标转换为自然语言空间。整个时间序列行人轨迹被转换为文本提示,场景图像通过图像描述转换为文本信息。转换后的数值和图像数据然后被包装到问答模板中,用于语言模型。为了引导语言模型理解和推理高级知识,如场景上下文和行人之间的社交关系,我们引入一个辅助多任务问答。我们随后训练一个数值tokenizer与提示数据配合。我们鼓励tokenizer良好地分离整数和小数部分,并利用它在语言模型中捕获连续数字之间的相关性。最后,我们使用数值tokenizer和所有问答提示训练语言模型。我们提出一种基于beam search的最可能预测和基于温度的多模态预测,以实现确定性和随机推断。应用我们的LMTraj,我们显示语言模型可以是强大的行人轨迹预测器,超过现有的基于数值的方法。代码可在 https://github.com/inhwanbae/LMTrajectory 公开获取。

关键词

引用

@article{arxiv.2403.18447,
  title  = {Can Language Beat Numerical Regression? Language-Based Multimodal Trajectory Prediction},
  author = {Inhwan Bae and Junoh Lee and Hae-Gon Jeon},
  journal= {arXiv preprint arXiv:2403.18447},
  year   = {2024}
}

备注

Accepted at CVPR 2024