Video ChatCaptioner:面向丰富的时空描述
计算机视觉与模式识别
2023-05-25 v3 人工智能
摘要
视频字幕旨在用自然语言传达视频中的动态场景,促进对我们环境中时空信息的理解。尽管近期取得了进展,生成详细且丰富的视频描述仍是一项重大挑战。本工作中,我们提出Video ChatCaptioner,一种用于创建更全面的时空视频描述的创新方法。我们的方法采用ChatGPT模型作为控制器,专门设计用于选择帧以提出由视频内容驱动的问题。随后,利用一个鲁棒算法来回答这些视觉查询。该问答框架有效揭示了复杂的视频细节,并有望作为一种增强视频内容的方法。经过多轮对话后,ChatGPT可基于先前的对话总结丰富的视频内容。我们定性地展示了我们的Video ChatCaptioner能够生成包含更多视频视觉细节的字幕。代码公开于 https://github.com/Vision-CAIR/ChatCaptioner
引用
@article{arxiv.2304.04227,
title = {Video ChatCaptioner: Towards Enriched Spatiotemporal Descriptions},
author = {Jun Chen and Deyao Zhu and Kilichbek Haydarov and Xiang Li and Mohamed Elhoseiny},
journal= {arXiv preprint arXiv:2304.04227},
year = {2023}
}