中文

教师与求解者智能体之间的反思性对话用于视频问答

计算机视觉与模式识别 2026-05-28 v1

摘要

已有多种方法被提出用于将视觉-语言模型适应到视频问答的专门领域,包括微调和上下文学习。然而,在推理阶段仅从少量标注的支持集获取任务特定知识而不进行微调仍然是一个挑战。在本文中,我们提出了一种仅通过推理时上下文注入实现适应的方法。我们的方法首先构建一个反思性对话——两个智能体之间的多轮对话,其中教师提出每个支持问题并提供正确性反馈,求解者回答问题并为正确和错误的答案提供视觉基础解释(或反思)。然后,该对话历史在推理阶段被用作上下文。在EgoCross基准上的实验表明,我们的方法优于基线零样本设置和直接传递支持集示例的标准上下文学习方法,在CVPR 2026 EgoVis研讨会的首届跨领域EgoCross挑战赛开源赛道中获得第三名,本文也作为该挑战赛的技术报告。

关键词

引用

@article{arxiv.2605.27885,
  title  = {Reflective Dialogue between Teacher and Solver Agents for Video Question Answering},
  author = {Takuya Murakawa and Toru Tamaki},
  journal= {arXiv preprint arXiv:2605.27885},
  year   = {2026}
}

备注

Yhis paper serves as the technical report for the 1st Cross-Domain EgoCross Challenge @ EgoVis Workshop, CVPR 2026