中文

CLSP:用于智能体状态表示的高保真对比语言-状态预训练方法

人工智能 2024-09-25 v1

摘要

随着人工智能的快速发展,多模态学习已成为重要的研究领域。对于智能体而言,状态是一种关键模态,能够精确地传递信息,与常见的图像、视频和语言等模态并列。这一点在智能体广泛采用强化学习和多模态大型语言模型后尤为明显。然而,状态模态的表征仍处于发展滞后阶段。为此,我们提出了一种高保真对比语言-状态预训练(CLSP)方法,能够准确地将状态信息编码为可用于强化学习和多模态大型语言模型的通用表示。具体而言,我们首先设计了一种基于分类的预训练任务,以训练一个包含粗粒度信息的编码器。接着,我们构建了状态与语言描述的数据对,利用预训练编码器初始化CLSP编码器。然后,我们部署对比学习来训练CLSP编码器,以有效地表示精确的状态信息。此外,我们采用随机傅里叶特征(RFF)方法来增强数值信息的表示,以实现高保真映射。大量实验表明,我们的表示方法在精度和泛化能力方面具有优势,在文本-状态检索、强化学习导航任务和多模态大型语言模型理解等方面取得了卓越的结果。

关键词

引用

@article{arxiv.2409.15806,
  title  = {CLSP: High-Fidelity Contrastive Language-State Pre-training for Agent State Representation},
  author = {Fuxian Huang and Qi Zhang and Shaopeng Zhai and Jie Wang and Tianyi Zhang and Haoran Zhang and Ming Zhou and Yu Liu and Yu Qiao},
  journal= {arXiv preprint arXiv:2409.15806},
  year   = {2024}
}