返回路径:Q 导向的返回条件监督学习
机器学习
2026-05-29 v1 人工智能
摘要
受控序列模型(CSM)通过将返回路径(RTG)视为控制信号来学习策略。然而,现有的 CSM 常将 RTG 作为简单的数值输入,而非与其策略性能对齐。在本文中,我们提出了 Q-ALIGN DT 框架,通过确保输出策略的 Q 值与输入 RTG 一致来实现这种对齐。我们利用 Q 函数为 CSM 提供稠密指导,并通过 RTG 扰动技术对其进行微调,确保更高的 RTG 对应更高的预期回报。理论上,我们证明了 Q-ALIGN DT 在 RTG 足够高时能够高效学习所需策略并输出近最优策略。实证上,我们通过大量实验表明,Q-ALIGN DT 在 D4RL 基准上实现了卓越的可控性和性能。惊人的是,我们的模型有效学习了一族结构化的策略,保持精确的对齐并推广到速度跟踪等任务,其中先前方法难以实现。
引用
@article{arxiv.2605.29028,
title = {Return-to-Go Is More Than a Number: Q-Guided Alignment for Return-Conditioned Supervised Learning},
author = {Yuxiao Yang and Weitong Zhang},
journal= {arXiv preprint arXiv:2605.29028},
year = {2026}
}
备注
28 pages, 13 figures, 20 tables, accepted by ICML 2026