面向多智能体轨迹预测的视觉与意图感知社交注意力框架VISTA
计算机视觉与模式识别
2025-11-14 v1 人工智能
机器人学
摘要
多智能体轨迹预测是 autonomous systems 在密集且互动环境中运作的关键任务。现有方法往往难以同时捕获agents的长期目标及其细粒度的社交互动,从而导致不真实的多智能体未来。我们提出VISTA,一个用于多智能体轨迹预测的递归目标条件变换器。VISTA融合了(i)一种跨注意力模块,用于整合长期意图与过去运动,(ii)一种社交token注意力机制,用于跨agents灵活的互动建模,以及(iii)成对注意力图,在推理时使社交影响模式具有可解释性。我们的模型将单agent目标条件预测转化为连贯的多agent预测框架。除标准位移度量外,我们评估了轨迹碰撞率作为联合真实性的度量。在高密度MADRAS基准和SDD上,VISTA实现了最先进的准确性,并显著减少了碰撞。在MADRAS上,它将强基线的平均碰撞率从2.14%降低至0.03%;在SDD上,VISTA在实现零碰撞的同时,改进了ADE、FDE和minFDE。这些结果表明,VISTA生成的轨迹在社交合规性、目标感知性和可解释性方面均表现出色,为安全关键的autonomous系统提供了可行方案。
引用
@article{arxiv.2511.10203,
title = {VISTA: A Vision and Intent-Aware Social Attention Framework for Multi-Agent Trajectory Prediction},
author = {Stephane Da Silva Martins and Emanuel Aldea and Sylvie Le Hégarat-Mascle},
journal= {arXiv preprint arXiv:2511.10203},
year = {2025}
}
备注
Paper accepted at WACV 2026