CuriosAI 在 EgoVis 2026 CASTLE 挑战赛中的提交方案
计算机视觉与模式识别
2026-05-28 v1
摘要
CASTLE 2026 挑战赛针对超过600小时同步多视角自我中心视频提出了185个多项选择题。我们在一个共享的多模态预处理层之上探索了两种方法,该预处理层包括个人时间线、说话人解析的转录文本和多VLM字幕集成。方法A, SVA (Search-Verify-Answer, 搜索-验证-回答),是一个三阶段流水线:分层缩小到主窗口,在四种反虚构规则下使用VLM验证子窗口,并在证据优先级层次结构下使用LLM法官融合证据。方法B, TMKG (Temporal-Multimodal-Knowledge-Graph, 时间-多模态-知识图谱),则形成对比:它构建一个时间多模态知识图谱,通过图搜索定位主单元,并使用单个接地VLM生成最终答案。SVA在排行榜上达到了0.50的准确率,是我们的最终挑战提交方案;TMKG达到了0.35。
引用
@article{arxiv.2605.27800,
title = {CuriosAI Submission to the CASTLE Challenge at EgoVis 2026},
author = {Yuto Kanda and Hayato Tanoue and Takayuki Hori},
journal= {arXiv preprint arXiv:2605.27800},
year = {2026}
}
备注
The 4th place solution for the CASTLE Challenge at the CVPR EgoVis Workshop 2026