潜在动作为何失败及如何预防
计算机视觉与模式识别
2026-05-21 v1
摘要
潜在动作模型 (LAMs) 旨在通过压缩帧间变化,从无标签视频中学习类似动作的表示。然而,自然场景视频的帧不仅包含智能体自身的状态,还包含背景杂乱等外生状态。由于外生状态引入了与动作无关的变化,它阻碍了可靠的潜在动作学习。本文通过扩展一个线性 LAM 框架以显式建模外生状态,对该问题进行了分析性研究。我们的分析揭示了两点洞见:(1) 最小化标准重建目标会产生编码了来自未来观测的外生信息的潜在动作;(2) 在一个专注于内生组件的表示空间中进行学习,是减轻噪声干扰的关键。我们进一步证明,先前提出的辅助目标,如动作监督,可证明地鼓励潜在动作在不同外生状态下保持一致。这些发现通过对线性和非线性 LAM 的实验得到了验证,为外生状态如何阻碍潜在动作学习以及常见补救措施为何有效提供了统一的理论分析。
引用
@article{arxiv.2605.20223,
title = {Why Latent Actions Fail, and How to Prevent It},
author = {Jung Min Lee and Taehyun Cho and Li Zhao and Jungwoo Lee},
journal= {arXiv preprint arXiv:2605.20223},
year = {2026}
}