EgoAdapt:面向CVPR 2026 HD-EPIC VQA挑战赛的多场景自我中心自适应方法
计算机视觉与模式识别
2026-05-26 v1
摘要
本技术报告介绍了我们针对CVPR 2026 HD-EPIC VQA挑战赛的解决方案EgoAdapt(通过类别、校准和一致性实现自我中心自适应)。HD-EPIC评估视觉-语言模型能否对逼真的第一人称厨房视频进行推理,其中答案的证据可能是一次短暂的手物交互、一段长食谱轨迹、与固定装置的空间关系或一个微妙的注视线索。该基准测试包含2.6万个多选题,涵盖七个宏观类别:食谱、食材、营养、细粒度动作、3D感知、物体运动和注视。我们观察到,主要困难不仅在于模型能力,还在于单一通用推理方案与基准测试中异构的时间、空间和语义结构之间的不匹配。我们的方法EgoAdapt引入了三个推理时组件:(1)基于类别条件路由,为每个类别定制提示、帧预算和采样率;(2)校准选项评分,评估所有候选答案,结合字母标记似然和生成一致性,而非仅依赖直接生成;(3)测试时一致性自适应,针对模糊情况,聚合不同选项排列和验证式提示的预测结果。这种设计显著优于现有的HD-EPIC基线。
引用
@article{arxiv.2605.24500,
title = {EgoAdapt: A Multi-Scene Egocentric Adaptation Method for CVPR 2026 HD-EPIC VQA Challenge},
author = {Zhiwei Chen and Yupeng Hu and Zixu Li and Zhiheng Fu and Guozhi Qiu and Weili Guan and Liqiang Nie},
journal= {arXiv preprint arXiv:2605.24500},
year = {2026}
}
备注
Technical Report for CVPR 2026 HD-EPIC VQA Challenge