PVChat:基于单样本学习的个性化视频聊天
计算机视觉与模式识别
2025-08-19 v4 人工智能
摘要
视频大语言模型(ViLLM)在一般视频理解方面表现突出,例如识别说话和进食等活动,但在身份感知理解方面有限,例如"Wilson 正在接受化疗"或"Tom 正在与 Sarah 讨论",限制了其在智能医疗和智能家居环境中的应用。为此,我们提出一种单样本学习框架 PVChat,这是首个实现主体感知问答(QA)的个性化 ViLLM,使其能够从每个主体的单个视频中进行主体-aware 问答。我们的方法在合成增强的视频-QA 数据集上优化 Mixture-of-Heads(MoH)增强的 ViLLM,采用渐进式图像到视频学习策略。具体而言,我们引入自动化增强管道,用于合成保留身份的正样本并从现有视频语料库中检索硬负样本,生成包含四种 QA 类型:存在、外观、动作和位置查询的多样化训练数据集。为增强主体特定学习,我们提出了 ReLU 路由 MoH 注意力机制,以及两个新目标:(1) Smooth Proximity Regularization 用于通过指数距离缩放实现渐进式学习;(2) Head Activation Enhancement 用于实现注意力路由的平衡。最后,我们采用两阶段训练策略,从图像预训练过渡到视频微调,实现从静态属性到动态表示的渐进式学习。我们在覆盖医疗场景、电视系列、动漫和真实场景 footage 的多样化数据集上进行评估,证明在仅从单个视频学习的情况下,PVChat 在个性化特征理解方面优于当前最先进的 ViLLM。
引用
@article{arxiv.2503.17069,
title = {PVChat: Personalized Video Chat with One-Shot Learning},
author = {Yufei Shi and Weilong Yan and Gang Xu and Yumeng Li and Yucheng Chen and Zhenxi Li and Fei Richard Yu and Ming Li and Si Yong Yeo},
journal= {arXiv preprint arXiv:2503.17069},
year = {2025}
}