ShipTraj-R1:通过群相对政策优化强化船舶轨迹预测于大语言模型
人工智能
2026-03-04 v1
摘要
近期的强化微调进展显著提升了大语言模型(LLMs)的推理能力。特别是诸如群相对政策优化(GRPO)等方法在各领域展现出强大的能力。然而,将LLMs应用于船舶轨迹预测仍 largely未探索。本文提出ShipTraj-R1,一个 novel的LLM-based框架,将船舶轨迹预测重新表述为文本到文本生成问题。(1)我们设计包含关于冲突船舶轨迹信息的动态提示,以引导模型实现自适应链路推理(CoT)。(2)我们引入全面的基于规则奖励机制以激励推理格式和预测准确性。(3)我们的ShipTraj-R1通过GRPO机制实现强化,由特定于领域的提示和奖励驱动,并使用Qwen3作为模型 backbone。大量实验结果表明,在两个复杂且真实的海洋数据集上,提出的ShipTraj-R1在与SOTA深度学习和LLM-based基线相比,实现了最少的误差。
引用
@article{arxiv.2603.02939,
title = {ShipTraj-R1: Reinforcing Ship Trajectory Prediction in Large Language Models via Group Relative Policy Optimization},
author = {Yang Zhan and Yunhao Li and Zhang Chao and Yuxu Lu and Yan Li},
journal= {arXiv preprint arXiv:2603.02939},
year = {2026}
}
备注
Accepted by the 30th Pacific-Asia Conference on Knowledge Discovery and Data Mining (PAKDD2026)