HCQA @ Ego4D EgoSchema Challenge 2024
计算机视觉与模式识别
2024-10-30 v2 人工智能
摘要
本文报告了我们在 CVPR 2024 上 Ego4D EgoSchema 挑战赛中获胜解决方案。为深度融合强大的 egocentric 字幕模型和 question reasoning 模型,我们提出了一种名为 HCQA 的层次化理解方案,用于egocentric 视频问答。HCQA 包含三个阶段:细粒度字幕生成、上下文驱动的总结和推理引导的问答。给定一个长篇视频,HCQA 通过细粒度字幕生成和上下文驱动的总结分别捕获局部详细视觉信息和全局总结视觉信息。随后在推理引导的问答中,HCQA 利用这种层次化信息进行推理和回答。在 EgoSchema 盲测数据集上,HCQA 在回答超过 5,000 个人类精选多选问题时实现了 75% 的准确率。我们的代码将在 https://github.com/Hyu-Zhang/HCQA 上发布。
引用
@article{arxiv.2406.15771,
title = {HCQA @ Ego4D EgoSchema Challenge 2024},
author = {Haoyu Zhang and Yuquan Xie and Yisen Feng and Zaijing Li and Meng Liu and Liqiang Nie},
journal= {arXiv preprint arXiv:2406.15771},
year = {2024}
}
备注
The champion solution for Ego4D EgoSchema Challenge in CVPR EgoVis Workshop 2024