中文

面向公共卫生领域的DPO偏好鲁棒性及其应用

机器学习 2025-11-19 v2

摘要

我们研究了LLM微调任务,用于设计受自然语言中人类偏好表达引导的序列资源分配问题的奖励函数。该设置构成了对齐的具有挑战性的测试基准,因其目标复杂且模糊,数据获取有限。我们提出了DPO-PRO,即一种基于直接偏好优化(DPO)的鲁棒微调算法,利用轻量分布式鲁棒优化(DRO)公式考虑偏好分布的不确定性。不同于先前基于DRO的DPO方法,DPO-PRO显著不那么保守。我们在由非营利组织ARMMAN运营的真实世界产妇移动健康项目中评估了DPO-PRO,同时在标准对齐基准测试中进行测试。实验结果表明,我们的方法在应对噪声偏好信号方面 consistently 改善了鲁棒性,优于现有DPO变体。此外,DPO-PRO在奖励函数设计方面实现了与先前自反思基线相当的性能,同时所需的推理时间成本显著降低。

关键词

引用

@article{arxiv.2509.02709,
  title  = {Preference Robustness for DPO with Applications to Public Health},
  author = {Cheol Woo Kim and Shresth Verma and Mauricio Tec and Milind Tambe},
  journal= {arXiv preprint arXiv:2509.02709},
  year   = {2025}
}