中文

超越“暂停”与“播放”:将GPT-4o空间弱点转化为深度交互式视频学习的优势

计算机视觉与模式识别 2025-08-26 v1 人工智能

摘要

传统视频学习方式被动,用户无法与内容进行动态互动。虽然当前AI工具提供转录和摘要功能,但缺乏实时、区域特定的交互能力。本文提出Untwist系统,使其能够实现交互式视频学习,允许用户通过整个视频或特定区域(使用边界框)提问,接收上下文感知的多模态响应。通过将GPT API与计算机视觉技术集成,Untwist从视频中提取、处理和结构化内容以增强理解。我们的做法通过利用标注帧而非原始坐标数据来解决GPT-4o空间弱点问题,显著提高了局部化和解释视频内容的准确性。这篇论文描述了系统架构,包括视频预处理和实时交互,阐述了Untwist如何将被动视频消费转化为具有交互性和AI驱动学习潜力的体验,从而提升用户参与度和理解水平。

关键词

引用

@article{arxiv.2508.17160,
  title  = {Beyond Play and Pause: Turning GPT-4o Spatial Weakness into a Strength for In-Depth Interactive Video Learning},
  author = {Sajad Goudarzi and Samaneh Zamanifard},
  journal= {arXiv preprint arXiv:2508.17160},
  year   = {2025}
}