中文

EgoTextVQA: 面向以场景文本为导向的自我视角视频问答

计算机视觉与模式识别 2025-03-24 v2 多媒体

摘要

我们提出 EgoTextVQA,这是一个用于自我视角场景文本问答辅助的新型且严谨构建的基准数据集。EgoTextVQA 包含 1.5K 个自我视角视频和 7K 个具备场景文本感知能力的问答问题,反映真实用户在户外驾驶和室内家务活动中的需求。这些问题旨在引导对场景文本在自我视角和动态环境中的识别与推理。基于 EgoTextVQA,我们全面评估了 10 个主流多模态大语言模型。目前,所有模型均表现不佳,最佳结果(Gemini 1.5 Pro)约为 33% 的准确率,这凸显了这些技术在自我视角问答辅助方面的严重不足。我们的进一步调查表明,精确的时间定位、多帧推理,以及高分辨率和辅助场景文本输入,对提升性能至关重要。借助详尽的分析和启发性建议,我们希望 EgoTextVQA 能作为自我视角场景文本问答辅助研究的坚实基准平台。本数据集已发布于:https://github.com/zhousheng97/EgoTextVQA

关键词

引用

@article{arxiv.2502.07411,
  title  = {EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering},
  author = {Sheng Zhou and Junbin Xiao and Qingyun Li and Yicong Li and Xun Yang and Dan Guo and Meng Wang and Tat-Seng Chua and Angela Yao},
  journal= {arXiv preprint arXiv:2502.07411},
  year   = {2025}
}

备注

Accepted by CVPR 2025