中文

CuriosAI 在 EgoVis 2026 CASTLE 挑战赛中的提交方案

计算机视觉与模式识别 2026-05-28 v1

摘要

CASTLE 2026 挑战赛针对超过600小时同步多视角自我中心视频提出了185个多项选择题。我们在一个共享的多模态预处理层之上探索了两种方法,该预处理层包括个人时间线、说话人解析的转录文本和多VLM字幕集成。方法A, SVA (Search-Verify-Answer, 搜索-验证-回答),是一个三阶段流水线:分层缩小到主窗口,在四种反虚构规则下使用VLM验证子窗口,并在证据优先级层次结构下使用LLM法官融合证据。方法B, TMKG (Temporal-Multimodal-Knowledge-Graph, 时间-多模态-知识图谱),则形成对比:它构建一个时间多模态知识图谱,通过图搜索定位主单元,并使用单个接地VLM生成最终答案。SVA在排行榜上达到了0.50的准确率,是我们的最终挑战提交方案;TMKG达到了0.35。

关键词

引用

@article{arxiv.2605.27800,
  title  = {CuriosAI Submission to the CASTLE Challenge at EgoVis 2026},
  author = {Yuto Kanda and Hayato Tanoue and Takayuki Hori},
  journal= {arXiv preprint arXiv:2605.27800},
  year   = {2026}
}

备注

The 4th place solution for the CASTLE Challenge at the CVPR EgoVis Workshop 2026