中文

OmAgent:用于复杂视频理解的多模态代理框架与任务分治

计算机视觉与模式识别 2024-11-13 v3 计算与语言

摘要

近期大型语言模型(LLM)的进展已扩展到多模态情境,包括综合性视频理解。然而,处理大规模视频(如24小时监控录像或完整电影) presents significant challenges due to the vast data and processing demands。传统方法(如提取关键帧或将帧转换为文本)常导致信息损失显著。为解决这些不足之处,我们开发了 OmAgent,高效存储和检索特定查询相关的视频帧,保留视频详细内容。此外,它具备分治循环(Divide-and-Conquer Loop),能够自主推理,动态调用 API 和工具以增强查询处理和准确性。该方法确保了稳健的视频理解,显著减少信息损失。实验结果确认 OmAgent 在处理各种类型视频和复杂任务方面的有效性。此外,我们赋予其更大的自主性和稳健的工具调用系统,使其能够完成更复杂的任务。

关键词

引用

@article{arxiv.2406.16620,
  title  = {OmAgent: A Multi-modal Agent Framework for Complex Video Understanding with Task Divide-and-Conquer},
  author = {Lu Zhang and Tiancheng Zhao and Heting Ying and Yibo Ma and Kyusong Lee},
  journal= {arXiv preprint arXiv:2406.16620},
  year   = {2024}
}