通过闭环世界建模实现视频化身中的主动智能
计算机视觉与模式识别
2025-12-24 v1
摘要
当前的视频化身生成方法在身份保持和运动对齐方面表现出色,但缺乏真正的能动性,它们无法通过自适应环境交互自主追求长期目标。我们通过引入L-IVA(长时程交互式视觉化身)——一个用于在随机生成环境中评估目标导向规划的任务和基准,以及ORCA(在线推理与认知架构)——首个在视频化身中实现主动智能的框架,来解决这一问题。ORCA通过两项关键创新体现了内部世界模型(IWM)能力:(1)一个闭环的OTAR循环(观察-思考-行动-反思),通过持续将预测结果与实际生成进行验证,在生成不确定性下保持稳健的状态追踪;(2)一个层次化的双系统架构,其中系统2执行带有状态预测的策略推理,而系统1将抽象计划转化为精确的、特定于模型的动作描述。通过将化身控制表述为部分可观测马尔可夫决策过程(POMDP)并实现带有结果验证的连续信念更新,ORCA能够在开放域场景中实现自主的多步骤任务完成。大量实验表明,ORCA在任务成功率和行为一致性方面显著优于开环和无反思的基线,验证了我们受IWM启发的设计,该设计将视频化身的智能从被动动画推进到主动的、目标导向的行为。
引用
@article{arxiv.2512.20615,
title = {Active Intelligence in Video Avatars via Closed-loop World Modeling},
author = {Xuanhua He and Tianyu Yang and Ke Cao and Ruiqi Wu and Cheng Meng and Yong Zhang and Zhuoliang Kang and Xiaoming Wei and Qifeng Chen},
journal= {arXiv preprint arXiv:2512.20615},
year = {2025}
}
备注
Project Page: https://xuanhuahe.github.io/ORCA/