基于转换稀疏性的奖励距离比较
机器学习
2025-04-17 v1
摘要
奖励比较对于评估由一组奖励函数诱导的代理人行为差异至关重要。大多数传统技术利用输入奖励函数来学习优化策略,然后用于比较代理人行为。然而,学习这些策略可能计算成本高昂,也可能引发安全问题。直接奖励比较技术可消除策略学习,但因数据收集挑战和可行性限制导致转换稀疏问题,即只有小部分转换被采样。现有的先进直接奖励比较方法不适用于稀疏条件,因为它们需要高转换覆盖率,即来自给定覆盖分布的大多数转换被采样。当不满足此要求时,采样与预期转换之间的分布不匹配可能导致显著错误。本文引入了稀疏韧性奖励距离(Sparsity Resilient Reward Distance, SRRD)伪度量,旨在通过容纳多样化样本分布来消除对高转换覆盖率的需求,这在稀疏条件下很常见。我们对SRRD的鲁棒性提供了理论依据,并在多个领域进行实验以展示其实际有效性。
引用
@article{arxiv.2504.11508,
title = {Reward Distance Comparisons Under Transition Sparsity},
author = {Clement Nyanhongo and Bruno Miranda Henrique and Eugene Santos},
journal= {arXiv preprint arXiv:2504.11508},
year = {2025}
}
备注
Published in the TMLR, https://openreview.net/forum?id=haP586YomL