揭示预训练语言模型中 Markov 头部在离线强化学习中的作用
机器学习
2025-06-10 v2
摘要
最近, 将预训练语言模型(PLMs)整合到 decision transformer(DTs)中, 在离线强化学习(RL)中引发了广泛关注。这些 PLMs 在 RL 任务中表现优异,引发了一个值得探讨的问题:PLMs 中的哪些知识被转移到 RL 中以实现如此好的效果?本工作首先通过定量分析每个注意力头部,指出 Markov 头部是注意力头部中关键组件。它导致对最后一个输入标记产生极端注意力,仅在短期环境中表现良好。此外,我们证明,这种极端注意力无法通过重新训练嵌入层或微调来改变。鼓励我们的分析,我们提出一种通用方法 GPT2-DTMA,为预训练 DT 配备混合注意力(Mixture of Attention, MoA),以适应微调期间对多样化注意力需求。大量实验验证了我们的定理,并证明了 GPT2-DTMA 的有效性:它在短期环境中实现了与原方法相当的性能,同时显著缩小了在长期环境中的性能差距。
引用
@article{arxiv.2409.06985,
title = {Unveiling Markov Heads in Pretrained Language Models for Offline Reinforcement Learning},
author = {Wenhao Zhao and Qiushui Xu and Linjie Xu and Lei Song and Jinyu Wang and Chunlai Zhou and Jiang Bian},
journal= {arXiv preprint arXiv:2409.06985},
year = {2025}
}
备注
The first two authors contributed equally. The order was decided by a dice roll