基于块状环注意力的百万长度视频与语言世界模型
机器学习
2025-02-05 v4
摘要
实现长上下文理解仍然是扩展现有序列模型的关键挑战——这是开发能够处理并操作可能包含数百万个标记的长时域的一般智能模型的关键组成部分。在本文中,我们旨在通过全面探索生成1M上下文语言模型和视频语言模型的完整开发过程来解决这些挑战,在语言检索和长视频理解方面设立了新的基准。我们详细介绍了长上下文数据整理过程、从4K到1M标记的渐进式上下文扩展,并提供了用于长序列可扩展训练的高效开源实现。此外,我们开源了一个7B参数模型系列,能够处理超过1M标记的长文本文档和视频。
引用
@article{arxiv.2402.08268,
title = {World Model on Million-Length Video And Language With Blockwise RingAttention},
author = {Hao Liu and Wilson Yan and Matei Zaharia and Pieter Abbeel},
journal= {arXiv preprint arXiv:2402.08268},
year = {2025}
}