用于更快速更准确无监督目标发现的奖励微调
计算机视觉与模式识别
2023-11-07 v2
摘要
机器学习的最新进展表明,基于人类反馈的强化学习(RLHF)可改进机器学习模型并使其与人类偏好对齐。尽管对大语言模型(LLMs)极为成功,这些进展在自动驾驶车辆研究中尚未产生可相比的影响——而此类研究中与人类期望的对齐可能至关重要。本文提出将类似的基于 RL 的方法适配于无监督目标发现,即从 LiDAR 点中无训练标签地学习检测目标。我们使用简单启发式方法而非标签来模拟人类反馈。更明确地说,我们将多种启发式组合为一个简单的奖励函数,其分数与边界框精度正相关,即包含目标的框得分高于不含目标的框。我们从检测器自身的预测出发探索空间,并通过梯度更新强化高奖励的框。经验上,我们证明与先前目标发现工作相比,我们的方法不仅更精确,且训练速度快数个数量级。
引用
@article{arxiv.2310.19080,
title = {Reward Finetuning for Faster and More Accurate Unsupervised Object Discovery},
author = {Katie Z Luo and Zhenzhen Liu and Xiangyu Chen and Yurong You and Sagie Benaim and Cheng Perng Phoo and Mark Campbell and Wen Sun and Bharath Hariharan and Kilian Q. Weinberger},
journal= {arXiv preprint arXiv:2310.19080},
year = {2023}
}