面向偏好学习的不确定性统一:一种案例研究
机器人学
2025-10-24 v2
摘要
学习人类偏好对于人机交互至关重要,因为它使机器人能够适应其行为以符合人类期望和目标。然而,人类行为和机器人系统中固有的不确定性使得偏好学习具有挑战性。虽然概率机器人算法提供了不确定性定量化,但人类偏好不确定性的集成仍被忽视。为弥合这一差距,我们引入不确定性统一并提出一种新型框架——不确定性统一偏好学习(UUPL),该框架通过统一人类和机器人不确定性来增强基于高斯过程(GP)的偏好学习。具体而言,UUPL包括改进GP后验均值估计的人类偏好不确定性模型,以及增强GP预测方差准确性的不确定性加权高斯混合模型(GMM)。此外,我们设计了一种用户特定的校准过程,以跨用户对齐不确定性表示,确保模型性能的一致性和可靠性。全面的实验和用户研究表明,UUPL在预测准确性和用户评级方面均实现了最先进的性能。进一步的消融研究进一步验证了UUPL的人类不确定性模型和不确定性加权GMM的有效性。
引用
@article{arxiv.2503.19317,
title = {Towards Uncertainty Unification: A Case Study for Preference Learning},
author = {Shaoting Peng and Haonan Chen and Katherine Driggs-Campbell},
journal= {arXiv preprint arXiv:2503.19317},
year = {2025}
}
备注
Project page: https://sites.google.com/view/uupl-rss25/home