中文

通过视觉程序生成理解VideoQA中的复杂性

计算机视觉与模式识别 2025-05-20 v1

摘要

我们提出了一种数据驱动的方法来分析视频问答(VideoQA)中的查询复杂性。基准设计的先前工作依赖人类专业知识来设计具有挑战性的问题,但我们通过实验表明,人类难以预测哪些问题对机器学习模型而言是困难的。我们的自动方法利用视觉问答中代码生成技术的最新进展,使用生成代码的复杂性作为问题难度的代理。我们证明该度量与模型性能的相关性显著优于人类估计。为实现这一洞察,我们提出了一种从代码估计问题复杂性的算法。它识别出与任意给定模型集合中最难问题相关的细粒度原语,便于未来扩展到新方法。最后,为进一步说明我们方法的效用,我们将其扩展至自动生成复杂问题,构建了一个比流行基准NExT-QA难1.9倍的新基准。

关键词

引用

@article{arxiv.2505.13429,
  title  = {Understanding Complexity in VideoQA via Visual Program Generation},
  author = {Cristobal Eyzaguirre and Igor Vasiljevic and Achal Dave and Jiajun Wu and Rares Andrei Ambrus and Thomas Kollar and Juan Carlos Niebles and Pavel Tokmakov},
  journal= {arXiv preprint arXiv:2505.13429},
  year   = {2025}
}