LLMPopcorn:探索 LLMs 作为流行微视频生成的助手
计算与语言
2026-01-27 v3 计算机视觉与模式识别
摘要
在微视频主导 TikTok 和 YouTube 等平台的时代,AI 生成的内容正接近电影级质量。下一个前沿是利用大型语言模型(LLMs)自主创建病毒式微视频,这是一个尚未被充分挖掘的潜力,可能塑造 AI 驱动内容创作的未来。为了弥补这一空白,本文首次探索了 LLM 辅助的流行微视频生成(LLMPopcorn)。我们选择爆米花作为本文的图标,因为它象征着休闲和娱乐,与本研究利用 LLMs 作为助手生成通常在休闲时间消费的流行微视频相一致。具体而言,我们实证研究了以下研究问题:(i) LLMs 如何被有效利用来辅助流行微视频生成?(ii) 基于提示的增强在多大程度上可以优化 LLM 生成的内容以提高流行度?(iii) 各种 LLMs 和视频生成器在流行微视频生成任务中的表现如何?通过探索这些问题,我们表明像 DeepSeek-V3 这样的先进 LLMs 可以生成流行度与人类内容相当的微视频。提示增强进一步提升了结果,而基准测试突出了 LLMs 方面的 DeepSeek-V3 和 R1,以及视频生成方面的 LTX-Video 和 HunyuanVideo。这项工作推进了 AI 辅助的微视频创作,并开辟了新的研究方向。代码在 https://github.com/GAIR-Lab/LLMPopcorn 公开获取。
引用
@article{arxiv.2502.12945,
title = {LLMPopcorn: Exploring LLMs as Assistants for Popular Micro-video Generation},
author = {Junchen Fu and Xuri Ge and Kaiwen Zheng and Alexandros Karatzoglou and Ioannis Arapakis and Xin Xin and Yongxin Ni and Joemon M. Jose},
journal= {arXiv preprint arXiv:2502.12945},
year = {2026}
}
备注
Accepted by ICASSP2026