面向控制参数不确定系统的软开关专家策略
计算与语言
2025-10-24 v1 人工智能
摘要
本文提出一种用于控制参数不确定且变化的系统的仿真基于强化学习算法。虽然仿真器在安全学习控制策略方面有用,但现实差距仍是主要挑战。为缓解此挑战,我们提出了两个阶段的算法。第一阶段,在仿真器中针对不同系统参数学习多个控制策略。第二阶段,针对实际系统,使用基于观察的在线凸优化算法自适应切换控制策略。这种方法预计比依赖单一策略解决现实差距的现有方法降低学习复杂度。
引用
@article{arxiv.2510.20154,
title = {Are Stereotypes Leading LLMs' Zero-Shot Stance Detection ?},
author = {Anthony Dubreuil and Antoine Gourru and Christine Largeron and Amine Trabelsi},
journal= {arXiv preprint arXiv:2510.20154},
year = {2025}
}
备注
Accepted in EMNLP 2025 (Main)