中文

A-IPO:面向意图驱动的自适应偏好优化

计算与语言 2026-01-29 v3

摘要

人类偏好多样且动态,受区域、文化和社会因素影响。现有的对齐方法如直接偏好优化 (DPO) 及其变体常默认向多数派观点,忽视少数意见,无法捕捉提示中潜在用户意图。为此,我们提出自适应意图驱动偏好优化 (A-IPO)。具体而言,A-IPO 引入意图模块,用于推断每个用户提示背后的潜在意图,并将其显式纳入奖励函数,以强化所选模型响应与用户潜在意图之间的对齐。我们在理论和实证方面表明,纳入意图-响应相似性项可使偏好边际增加 (λΔsim\lambda\,\Delta\mathrm{sim} 对数几率的正偏移),从而在所选与不符响应之间实现更清晰的分离。为评估,我们引入两个新基准数据集(Real-pref、Attack-pref)以及扩展版现有数据集(GlobalOpinionQA-Ext),以评估现实偏好和对抗性偏好对齐。通过显式建模多样化用户意图,A-IPO 实现了多元化偏好优化,同时增强了对抗性鲁棒性。全面实证评估表明,A-IPO 在所有关键指标上均优于现有基线:在 Real-pref 上提升最高达 +24.8 胜率和 +45.6 响应-意图一致性;在 Attack-pref 上提升最高达 +38.6 响应相似性和 +52.2 对抗鲁棒性;在 GlobalOpinionQA-Ext 上提升最高达 +54.6 意图一致性得分。

关键词

引用

@article{arxiv.2510.10077,
  title  = {A-IPO: Adaptive Intent-driven Preference Optimization},
  author = {Wenqing Wang and Muhammad Asif Ali and Ali Shoker and Ruohan Yang and Junyang Chen and Ying Sha and Huan Wang},
  journal= {arXiv preprint arXiv:2510.10077},
  year   = {2026}
}