从像素到图:用于HD-EPIC VQA挑战的场景图和知识图
计算机视觉与模式识别
2025-06-11 v1
摘要
本报告介绍了我们为2025年HD-EPIC VQA挑战开发的SceneNet和KnowledgeNet两种方法。SceneNet利用使用多模态大语言模型(MLLM)生成的场景图来捕获细粒度的对象交互、空间关系以及时空关联的事件。在此基础上,KnowledgeNet融合ConceptNet的外部常识知识,引入实体之间的高层语义连接,实现超越直接可观察视觉证据的推理。在七个HD-EPIC基准类别中,两种方法各自展现出独特的优势。我们的框架将两者结合,实现了挑战中44.21%的整体准确率,凸显其在复杂镜像VQA任务中的有效性。
引用
@article{arxiv.2506.08553,
title = {From Pixels to Graphs: using Scene and Knowledge Graphs for HD-EPIC VQA Challenge},
author = {Agnese Taluzzi and Davide Gesualdi and Riccardo Santambrogio and Chiara Plizzari and Francesca Palermo and Simone Mentasti and Matteo Matteucci},
journal= {arXiv preprint arXiv:2506.08553},
year = {2025}
}
备注
Technical report for the HD-EPIC VQA Challenge 2025 (1st place)