中文

基于边缘的智能 LLM 视频处理工具 ELLMPEG

机器学习 2026-02-03 v1 多媒体

摘要

大型语言模型(LLM)作为生成式 AI 系统(如 ChatGPT)的基础,正在改变多个领域和应用,包括多媒体领域,使其能够实现更高级的内容生成、分析和交互。然而,基于云端的 LLM 部署面临三个关键限制:高计算和能源需求、来自远程处理的隐私和可靠性风险,以及持续的 API 费用。近期在 agentic AI 方面的进展,特别是在结构化推理和工具使用方面,为利用开放且本地部署的工具和 LLM 提供了更好的方式。本文介绍 ELLMPEG,一个面向边缘的 agentic LLM 框架,用于自动生成视频处理命令。ELLMPEG 将工具感知的检索增强生成(RAG)与迭代自我反思相结合,即可在边缘端直接生成和本地验证可执行的 FFmpeg 和 VVenC 命令,消除对外部云 API 的依赖。为评估 ELLMPEG,我们收集了一个专门的提示数据集,包含 480 个涵盖 FFmpeg 和通用视频编码(VVC)编码器(VVenC)命令的多样化查询。我们验证了命令生成准确率,并评估了四个开源 LLM 在命令有效性、每秒生成的标记数、推理时间和能源效率方面的表现。我们还执行生成的命令以评估其运行时正确性和实际适用性。实验结果表明,借助 ELLMPEG 框架增强的 Qwen2.5 在 FFmpeg 和 VVenC 数据集上实现 78% 的平均命令生成准确率,实现零持续 API 费用,净响越其他所有开源模型。

关键词

引用

@article{arxiv.2602.00028,
  title  = {ELLMPEG: An Edge-based Agentic LLM Video Processing Tool},
  author = {Zoha Azimi and Reza Farahani and Radu Prodan and Christian Timmerer},
  journal= {arXiv preprint arXiv:2602.00028},
  year   = {2026}
}

备注

12 pages, 5 tables, 8 Figures, accepted for the MMSys 2026 conference