中文

用于更快速更准确无监督目标发现的奖励微调

计算机视觉与模式识别 2023-11-07 v2

摘要

机器学习的最新进展表明,基于人类反馈的强化学习(RLHF)可改进机器学习模型并使其与人类偏好对齐。尽管对大语言模型(LLMs)极为成功,这些进展在自动驾驶车辆研究中尚未产生可相比的影响——而此类研究中与人类期望的对齐可能至关重要。本文提出将类似的基于 RL 的方法适配于无监督目标发现,即从 LiDAR 点中无训练标签地学习检测目标。我们使用简单启发式方法而非标签来模拟人类反馈。更明确地说,我们将多种启发式组合为一个简单的奖励函数,其分数与边界框精度正相关,即包含目标的框得分高于不含目标的框。我们从检测器自身的预测出发探索空间,并通过梯度更新强化高奖励的框。经验上,我们证明与先前目标发现工作相比,我们的方法不仅更精确,且训练速度快数个数量级。

关键词

引用

@article{arxiv.2310.19080,
  title  = {Reward Finetuning for Faster and More Accurate Unsupervised Object Discovery},
  author = {Katie Z Luo and Zhenzhen Liu and Xiangyu Chen and Yurong You and Sagie Benaim and Cheng Perng Phoo and Mark Campbell and Wen Sun and Bharath Hariharan and Kilian Q. Weinberger},
  journal= {arXiv preprint arXiv:2310.19080},
  year   = {2023}
}