从文本到轨迹:探索安全强化学习中复杂约束的表示与分解
计算与语言
2025-08-06 v3 人工智能
摘要
安全强化学习 (RL) 需要在遵守特定约束的同时完成给定任务。以自然语言形式给出约束在实际场景中具有巨大的潜在价值, 由于其灵活的迁移能力和可访问性。先前的以自然语言约束进行的安全 RL 方法通常需要为每个约束手动设计成本函数, 这需要专业知识且缺乏灵活性。本文中, 我们发挥文本在该任务中的双重角色, 不仅用作约束的来源, 也用作训练信号。我们引入轨迹级文本约束翻译器 (Trajectory-level Textual Constraints Translator, TTCT) 来取代手动设计的成本函数。我们的实证结果表明, TTCT 有效地理解文本约束和轨迹, 通过 TTCT 训练的策略可以实现比标准成本函数更低的违规率。额外的研究表明, TTCT 对约束迁移环境具有零样本迁移能力。
引用
@article{arxiv.2412.08920,
title = {From Text to Trajectory: Exploring Complex Constraint Representation and Decomposition in Safe Reinforcement Learning},
author = {Pusen Dong and Tianchen Zhu and Yue Qiu and Haoyi Zhou and Jianxin Li},
journal= {arXiv preprint arXiv:2412.08920},
year = {2025}
}
备注
Accepted by NeurIPS 2024