AVATAR:基于强化学习的视频感知、听觉与推理智能体
计算机视觉与模式识别
2026-03-31 v4
摘要
跨模态长时程视频推理因需在多个模态之间进行精确的时空融合与对齐,具有较大的挑战性。虽然近期方法如群相对策略优化(Group Relative Policy Optimization, GRPO)在该领域展现了前景,但仍受制于三个关键局限:(1)基于on-policy设计导致数据效率低下;(2)优势消失问题,即组内相同或近乎相同的奖励值产生零化优势,从而消除学习信号;(3)统一信任分配失败,无法突出关键推理步骤。我们提出了AVATAR(Audio-Video Agent for Alignment and Reasoning,语音-视频对齐与推理智能体),通过两个核心组件来解决上述问题:(1)基于离策略的训练架构,通过重用过去的经验并获得更丰富的奖励多样性,从而提升样本效率并消除优势消失问题;(2)时序优势塑形(Temporal Advantage Shaping, TAS),一种信任分配策略,强调早期(规划)和晚期(综合)推理阶段。AVATAR在various基准测试中均取得优异性能,相较于Qwen2.5-Omni基线在MMVU上提升+5.4,OmniBench上提升+4.9,Video-Holmes上提升+4.5。此外,它相较于标准GRPO在OmniBench上提升+3.7,在Video-Holmes上提升+1.9,同时实现样本效率,仅需更少的生成式完成项即可达到目标性能。
引用
@article{arxiv.2508.03100,
title = {AVATAR: Reinforcement Learning to See, Hear, and Reason Over Video},
author = {Yogesh Kulkarni and Pooyan Fazli},
journal= {arXiv preprint arXiv:2508.03100},
year = {2026}
}
备注
CVPR 2026