中文

总结过去以预测未来:上下文的自然语言描述提升多模态物体交互预测

计算机视觉与模式识别 2024-03-12 v4 计算与语言

摘要

我们研究第一视角视频中的物体交互预测。该任务需要理解由过去对物体的动作所形成的时空上下文,称为动作上下文(action context)。我们提出 TransFusion,一种基于多模态 transformer 的架构。它通过总结动作上下文来利用语言的表现力。TransFusion 利用预训练的图像描述(image captioning)和视觉-语言模型从过去视频帧中提取动作上下文。该动作上下文与下一视频帧一起由多模态融合模块处理,以预测下一次物体交互。我们的模型支持更高效的端到端学习。大型预训练语言模型增添了常识与泛化能力。在 Ego4D 和 EPIC-KITCHENS-100 上的实验显示了我们多模态融合模型的有效性。它们也凸显了在看似仅需视觉的任务中使用基于语言的上下文摘要的益处。我们的方法在 Ego4D 测试集上以相对值计总体 mAP 超越最先进(state-of-the-art)方法 40.4%。我们通过 EPIC-KITCHENS-100 上的实验验证了 TransFusion 的有效性。视频与代码见 https://eth-ait.github.io/transfusion-proj/。

关键词

引用

@article{arxiv.2301.09209,
  title  = {Summarize the Past to Predict the Future: Natural Language Descriptions of Context Boost Multimodal Object Interaction Anticipation},
  author = {Razvan-George Pasca and Alexey Gavryushin and Muhammad Hamza and Yen-Ling Kuo and Kaichun Mo and Luc Van Gool and Otmar Hilliges and Xi Wang},
  journal= {arXiv preprint arXiv:2301.09209},
  year   = {2024}
}