理解基于动作量化的行为克隆
机器学习
2026-03-24 v1 机器学习
摘要
行为克隆是机器学习中的基本范式,使其能够在机器人、自动驾驶和生成模型等领域从专家演示中学习策略。自回归模型如Transformer在大型语言模型(LLM)和视觉语言-动作系统(VLA)中证明效果显著,但将自回归模型应用于连续控制需要通过量化来离散化动作,而这一做法已被广泛采用但理论上仍不明确。本文提供了该做法的理论基础。我们分析了量化误差如何沿着时序传播并与统计样本复杂度相互作用。我们表明,采用量化动作和log损失进行的行为克隆可实现最优样本复杂度,匹配现有下界,并且仅在量化误差呈多项式时序依赖下即可实现,前提是动力学稳定且策略满足概率光滑条件。我们进一步描述了不同量化方案何时满足或违反这些要求,并提出一种模型基的增强方法,理论上可改善误差界且无需策略光滑。最后,我们建立了基本限制,同时捕捉量化误差和统计复杂度的联合效应。
引用
@article{arxiv.2603.20538,
title = {Understanding Behavior Cloning with Action Quantization},
author = {Haoqun Cao and Tengyang Xie},
journal= {arXiv preprint arXiv:2603.20538},
year = {2026}
}