中文

优化GPT用于视频理解:零样本性能与提示工程

计算机视觉与模式识别 2025-04-29 v3 计算与语言 机器学习

摘要

在本研究中,我们解决了视频内容分类中的行业挑战,通过探索和优化GPT-based模型实现对七个关键视频质量类别的零样本分类。我们贡献了一种通过提示优化和政策细化来提高GPT性能的新方法,表明简化复杂政策显著减少误报。此外,我们引入了一种基于分解-聚合的提示工程技术,该技术优于传统单提示方法。这些在真实行业问题上的实验表明,恰当的提示设计可以在无需额外微调的情况下显著提升GPT的性能,为改善视频分类提供了一种有效且可扩展的解决方案。

关键词

引用

@article{arxiv.2502.09573,
  title  = {Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering},
  author = {Mark Beliaev and Victor Yang and Madhura Raju and Jiachen Sun and Xinghai Hu},
  journal= {arXiv preprint arXiv:2502.09573},
  year   = {2025}
}

备注

9 pages