中文

基于 LoRA 专家混合的新型可信视频摘要算法

计算机视觉与模式识别 2025-03-11 v1 人工智能 计算与语言

摘要

随着视频分享平台上用户生成内容的指数级增长,促进视频高效搜索与浏览的挑战受到了广泛关注。为提升用户快速定位和回顾相关视频的能力,生成简洁且信息丰富的视频摘要变得日益重要。Video-llama 是生成视频摘要的有效工具,但它无法有效统一和优化时空特征的建模,且需要大量计算资源和时间。因此,我们提出 MiLoRA-ViSum,以更高效地捕捉视频数据中固有的复杂时间动态与空间关系,并控制训练参数量。通过将传统的低秩自适应(LoRA)扩展为复杂的混合专家范式,MiLoRA-ViSum 融入了专为视频摘要任务定制的双时空自适应机制。该方法动态集成了专门的 LoRA 专家,每个专家均经过微调以处理特定的时间或空间维度。在 VideoXum 和 ActivityNet 数据集上的广泛评估表明,与 SOTA 模型相比,MiLoRA-ViSum 取得了最佳摘要性能,同时保持了显著更低的计算成本。所提出的混合专家策略结合双自适应机制,凸显了该模型在增强视频摘要能力方面的潜力,尤其是在兼顾效率与精度的大规模应用中。

关键词

引用

@article{arxiv.2503.06064,
  title  = {A Novel Trustworthy Video Summarization Algorithm Through a Mixture of LoRA Experts},
  author = {Wenzhuo Du and Gerun Wang and Guancheng Chen and Hang Zhao and Xin Li and Jian Gao},
  journal= {arXiv preprint arXiv:2503.06064},
  year   = {2025}
}