PEARL:面向个性化流式视频理解的模型
计算机视觉与模式识别
2026-03-24 v1 人工智能
信息检索
摘要
人类对新概念的认知本质上是流式过程:我们持续识别新对象或身份,并随时间更新记忆。然而,当前的多模态个性化方法主要局限于静态图像或离线视频,无法将连续视觉输入与即时现实反馈有效连接,限制了其为未来AI助手提供实时、交互式个性化响应的能力。为弥合这一差距,本文首次提出并正式定义了个性化流式视频理解(PSVU)这一新任务。为推动该新方向的研究,本文引入 PEARL-Bench,这是第一个专为评估该挑战性场景而设计的全面基准测试。它评估模型在特定时间戳下对个性化概念作出响应的能力,包含两种模式:(1)帧级模式,聚焦于离散帧中特定人物或物体;(2) novel 视频级模式,聚焦于连续帧中展开的个性化动作。PEARL-Bench 包含 132 个独立视频和 2,173 条带精确时间戳的细粒度标注。通过自动生成与人工验证相结合的管道,严格确保概念多样性和标注质量。为应对这一挑战性新任务,本文进一步提出 PEARL,这是一种即插即用、无需训练的策略,可作为强有力的基线。在 8 个离线和在线模型上的广泛评估表明,PEARL 实现了最新成果。值得注意的是,PEARL 在应用于 3 种不同架构时均能带来持续的 PSVU 改进,证明其是一种高效且稳健的策略。我们希望本工作推动视觉语言模型(VLM)的个性化,并激发进一步研究流式个性化 AI 助手的潜力。代码已公开于 https://github.com/Yuanhong-Zheng/PEARL。
引用
@article{arxiv.2603.20422,
title = {PEARL: Personalized Streaming Video Understanding Model},
author = {Yuanhong Zheng and Ruichuan An and Xiaopeng Lin and Yuxing Liu and Sihan Yang and Huanyu Zhang and Haodong Li and Qintong Zhang and Renrui Zhang and Guopeng Li and Yifan Zhang and Yuheng Li and Wentao Zhang},
journal= {arXiv preprint arXiv:2603.20422},
year = {2026}
}
备注
Arxiv Submission