MMDuet2:通过多轮强化学习增强视频多模态大语言模型的主动交互
计算机视觉与模式识别
2025-12-09 v1 计算与语言
摘要
视频多模态大语言模型(Video MLLM)的最新进展显著增强了视频理解和多模态交互能力。虽然大多数现有系统以轮次方式运行,模型仅在用户轮次之后才能回复,但在视频播放过程中主动决定何时回复是实时应用的一个有前景且具有挑战性的方向。在本工作中,我们提出了一种文本到文本的主动交互方法,模型基于对话历史和当前帧的视觉上下文,自主决定在每个轮次是回复还是保持沉默。为克服先前方法中的困难,如手动调节回复决策阈值和标注精确回复时间,我们引入了一种多轮强化学习方法,鼓励及时且准确的回复,而无需精确的回复时间标注。我们在52k个视频数据集上使用SFT和RL训练了MMDuet2模型,该数据集包含两种类型的对话。实验结果表明,MMDuet2在回复时机和质量方面优于现有的主动视频MLLM基线,在ProactiveVideoQA基准测试上达到了最先进性能。
引用
@article{arxiv.2512.06810,
title = {MMDuet2: Enhancing Proactive Interaction of Video MLLMs with Multi-Turn Reinforcement Learning},
author = {Yueqian Wang and Songxiang Liu and Disong Wang and Nuo Xu and Guanglu Wan and Huishuai Zhang and Dongyan Zhao},
journal= {arXiv preprint arXiv:2512.06810},
year = {2025}
}