利用人类反馈实现语义相关技能发现
机器学习
2026-04-28 v1 人工智能
摘要
无监督技能发现在强化学习中旨在内在激励代理人发现多样且有用的行为。然而,无约束的方法可能产生不安全、不道德或偏离目标的行为。为缓解这些风险并提高发现技能的实际可取性,最近的工作通过利用人类偏好反馈来实现技能发现过程的约束。然而,基于偏好的方法在反馈效率方面存在不足,且天然地难以处理由各种不同技能(如跑、跳、走等)组成的技能空间。为克服这一限制,我们引入语义标签化,一种新颖且高效的做法,利用人类的认知优势来识别和标记语义上有意义的行为。基于语义标签化,我们提出了语义相关技能发现(Semantically Relevant Skill Discovery, SRSD),这是一种人类在环方法,通过收集来自人类反馈的语义标签并学习奖励函数,以鼓励技能更具语义多样性和相关性。在我们在二维导航环境和四个 locomotion 环境中的实验中,我们证明了SRSD能够提高语义多样性,发现相关行为,同时在大规模行为中保持有效扩展。
引用
@article{arxiv.2604.24127,
title = {Leveraging Human Feedback for Semantically-Relevant Skill Discovery},
author = {Maxence Hussonnois and Thommen George Karimpanal and Santu Rana},
journal= {arXiv preprint arXiv:2604.24127},
year = {2026}
}
备注
Accepted at the 28th International Conference on Pattern Recognition (ICPR 2026)