优化GPT用于视频理解:零样本性能与提示工程
计算机视觉与模式识别
2025-04-29 v3 计算与语言
机器学习
摘要
在本研究中,我们解决了视频内容分类中的行业挑战,通过探索和优化GPT-based模型实现对七个关键视频质量类别的零样本分类。我们贡献了一种通过提示优化和政策细化来提高GPT性能的新方法,表明简化复杂政策显著减少误报。此外,我们引入了一种基于分解-聚合的提示工程技术,该技术优于传统单提示方法。这些在真实行业问题上的实验表明,恰当的提示设计可以在无需额外微调的情况下显著提升GPT的性能,为改善视频分类提供了一种有效且可扩展的解决方案。
引用
@article{arxiv.2502.09573,
title = {Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering},
author = {Mark Beliaev and Victor Yang and Madhura Raju and Jiachen Sun and Xinghai Hu},
journal= {arXiv preprint arXiv:2502.09573},
year = {2025}
}
备注
9 pages