关于生成式AI和大语言模型在视频生成、理解与流媒体中应用的综述
计算机视觉与模式识别
2024-04-26 v1 人工智能
多媒体
摘要
本文深入探讨了当前最热门的AI技术——生成式人工智能(Generative AI)和大语言模型(LLM)——如何重塑视频技术领域,包括视频生成、理解和流媒体。文章强调了这些技术在生成高度逼真视频方面的创新应用,这是弥合现实世界动态与数字创作之间差距的重大飞跃。该研究还探讨了LLM在视频理解方面的先进能力,展示了它们在从视觉内容中提取有意义信息方面的有效性,从而增强了我们与视频的交互。在视频流媒体领域,本文讨论了LLM如何促进更高效和以用户为中心的流媒体体验,根据个人观看者偏好调整内容传输。这篇全面的综述梳理了当前在将生成式AI和LLM应用于视频相关任务方面的成就、挑战和未来可能性,强调了这些技术在推动与多媒体、网络和AI社区相关的视频技术领域方面的巨大潜力。
引用
@article{arxiv.2404.16038,
title = {A Survey on Generative AI and LLM for Video Generation, Understanding, and Streaming},
author = {Pengyuan Zhou and Lin Wang and Zhi Liu and Yanbin Hao and Pan Hui and Sasu Tarkoma and Jussi Kangasharju},
journal= {arXiv preprint arXiv:2404.16038},
year = {2024}
}
备注
16 pages, 10 figures, 4 tables