Ego4D长期动作预测挑战赛2025技术报告
计算机视觉与模式识别
2025-06-12 v2 人工智能
摘要
在本报告中,我们提出了一个为Ego4D长期动作预测(LTA)任务开发的新型三阶段框架。受基础模型最新进展的启发,我们的方法包含三个阶段:特征提取、动作识别和长期动作预测。首先,使用高性能视觉编码器提取视觉特征。然后将这些特征输入Transformer以预测动词和名词,并结合动词-名词共现矩阵来提高识别准确率。最后,将预测的动词-名词对格式化为文本提示,并输入到微调后的大语言模型(LLM)中以预测未来的动作序列。我们的框架在CVPR 2025的该挑战赛中荣获第一名,在长期动作预测领域确立了新的SOTA。我们的代码将发布于 https://github.com/CorrineQiu/Ego4D-LTA-Challenge-2025。
引用
@article{arxiv.2506.02550,
title = {Technical Report for Ego4D Long-Term Action Anticipation Challenge 2025},
author = {Qiaohui Chu and Haoyu Zhang and Yisen Feng and Meng Liu and Weili Guan and Yaowei Wang and Liqiang Nie},
journal= {arXiv preprint arXiv:2506.02550},
year = {2025}
}
备注
The champion solution for the Ego4D Long-Term Action Anticipation Challenge at the CVPR EgoVis Workshop 2025