CVPR'2023 AQTC挑战赛解决方案:面向多步推理的视频对齐
计算机视觉与模式识别
2023-06-27 v1 多媒体
摘要
以可供性为中心的问题驱动任务完成(AQTC)用于以自我为中心的辅助系统,引入了一种开创性的场景。在该场景中,通过学习教学视频,AI助手为用户提供逐步操作设备的指导。本文提出了一种通过增强视频对齐来改进多步推理的解决方案。具体而言,我们首先利用VideoCLIP生成视频-脚本对齐特征。随后,我们在教学视频中定位与问题相关的内容。接着,我们对多模态上下文进行重加权以突出显著特征。最后,我们采用GRU进行多步推理。通过全面的实验,我们证明了方法的有效性和优越性,该方案在CVPR'2023 AQTC挑战赛中获得了第2名。我们的代码可在 https://github.com/zcfinal/LOVEU-CVPR23-AQTC 获取。
引用
@article{arxiv.2306.14412,
title = {A Solution to CVPR'2023 AQTC Challenge: Video Alignment for Multi-Step Inference},
author = {Chao Zhang and Shiwei Wu and Sirui Zhao and Tong Xu and Enhong Chen},
journal= {arXiv preprint arXiv:2306.14412},
year = {2023}
}
备注
5 pages, 1 figure, technical report for track3 of CVPR 2023 LOVEU challenge