中文

ProactiveVideoQA:评估视频大语言模型主动交互的综合基准

计算机视觉与模式识别 2025-07-16 v2

摘要

随着多模态对话系统研究的不断关注,主动交互能力正逐渐受到重视。作为传统轮次式对话的替代方案,用户越来越期望多模态系统在视频播放期间能够自主决定多轮响应的时机。为推动这一新兴领域的进展,我们介绍了ProactiveVideoQA,即第一个综合性基准,用于评估系统参与主动交互的能力。由于模型响应在不同时间戳生成,我们进一步提出了PAUC,该指标首次考虑了模型响应的时间动态。这使得对主动环境下系统的评估更加准确。在ProactiveVideoQA上对各种基线系统进行广泛基准测试以及对人类偏好的用户研究中,我们展示了PAUC比传统评估指标更符合人类偏好,这些指标通常仅考虑响应的文本内容。这些发现表明,PAUC在主动交互场景中提供了更忠实的用户体验评估。项目主页:https://github.com/yellow-binary-tree/ProactiveVideoQA

关键词

引用

@article{arxiv.2507.09313,
  title  = {ProactiveVideoQA: A Comprehensive Benchmark Evaluating Proactive Interactions in Video Large Language Models},
  author = {Yueqian Wang and Xiaojun Meng and Yifan Wang and Huishuai Zhang and Dongyan Zhao},
  journal= {arXiv preprint arXiv:2507.09313},
  year   = {2025}
}