中文

Video-VoT-R1:集成图像打包与AoE架构的高效视频推理模型

人工智能 2025-03-21 v1

摘要

在视频语言预训练领域,现有模型在推理效率和多模态数据处理方面面临诸多挑战。本文提出一种基于长序列图像编码器的KunLunBaize-VoT-R1视频推理模型,及其训练与应用方法。通过集成图像打包技术、Autonomy-of-Experts(AoE)架构,结合Video of Thought(VoT)——一种基于大规模强化学习训练的大型语言模型(LLM),以及多项训练技术,显著提升了该模型在视频推理任务中的效率与准确性。实验表明,该模型在多个测试中表现卓越,为视频语言理解提供了新的解决方案。

关键词

引用

@article{arxiv.2503.15807,
  title  = {Video-VoT-R1: An efficient video inference model integrating image packing and AoE architecture},
  author = {Cheng Li and Jiexiong Liu and Yixuan Chen and Yanqin Jia},
  journal= {arXiv preprint arXiv:2503.15807},
  year   = {2025}
}

备注

18 pages