CVPR'2023 AQTC 挑战赛冠军方案:一种以功能-交互为中心并带时空视觉-语言对齐的方法
计算机视觉与模式识别
2023-06-26 v1
摘要
以功能为中心的问题驱动任务完成(AQTC)被提出用于从视频中获取知识,从而为用户提供全面且系统的指导。然而,现有方法迄今忽视了对齐时空视觉与语言信号的必要性,以及人与物体之间关键的交互信息。为应对这些局限,我们提出结合大规模预训练的视觉-语言与视频-语言模型,它们有助于提供稳定可靠的多模态数据并促进有效的时空视觉-文本对齐。此外,提出了一种新颖的手-物交互(HOI)聚合模块,有助于捕捉人-物交互信息,从而进一步增强理解所呈现场景的能力。我们的方法在 CVPR'2023 AQTC 挑战赛中取得第一名,Recall@1 得分为 78.7%。代码可在 https://github.com/tomchen-ctj/CVPR23-LOVEU-AQTC 获取。
引用
@article{arxiv.2306.13380,
title = {First Place Solution to the CVPR'2023 AQTC Challenge: A Function-Interaction Centric Approach with Spatiotemporal Visual-Language Alignment},
author = {Tom Tongjia Chen and Hongshan Yu and Zhengeng Yang and Ming Li and Zechuan Li and Jingwen Wang and Wei Miao and Wei Sun and Chen Chen},
journal= {arXiv preprint arXiv:2306.13380},
year = {2023}
}
备注
Winner of CVPR2023 Long-form Video Understanding and Generation Challenge (Track 3)