中文

基于大语言模型的双向动作序列学习用于长期动作预测

计算机视觉与模式识别 2025-08-04 v1

摘要

视频-based 长期动作预测对于自动驾驶和机器人等领域的早期风险检测至关重要。传统方法使用编码器提取过去动作的特征,并用解码器预测未来事件,受限于其单向 nature,性能受限。这些方法难以捕捉场景中语义上不同的子动作。提出的方法 BiAnt 通过结合前向预测和后向预测,利用大语言模型来克服这一限制。Ego4D 上的实验结果表明,BiAnt 在编辑距离方面优于基线方法。

关键词

引用

@article{arxiv.2508.00374,
  title  = {Bidirectional Action Sequence Learning for Long-term Action Anticipation with Large Language Models},
  author = {Yuji Sato and Yasunori Ishii and Takayoshi Yamashita},
  journal= {arXiv preprint arXiv:2508.00374},
  year   = {2025}
}

备注

Accepted to MVA2025 (Best Poster Award)