HEAL:基于假设的偏好感知分析框架
计算与语言
2025-08-28 v1
摘要
偏好优化方法(如DPO)在LLM对齐方面取得了显著的性能。然而,这些方法的评估仅依赖单一响应,忽略了在这一假设空间中可能生成的其他输出。为此,本文提出了基于假设的Pr偏好感知分析框架(HEAL),一种新的评估范式,将偏好对齐形式化为假设空间内的重排序过程。该框架包含两种互补指标:排序准确率用于评估序数一致性,偏好强度相关性用于评估连续对齐。为支持该框架,我们开发了UniHypoBench——一个来自多样化指令-响应对的统一假设基准。通过基于HEAL的大量实验(特别关注偏好学习的内在机制),我们证明当前的偏好学习方法能够有效捕获由代理模型提供的偏好,同时抑制负样本。这些发现通过两个重要途径推动了偏好学习研究。理论上,假设空间分析作为一种新颖的偏好对齐理解范式得到了引入。实践上,HEAL为研究人员提供了强大的诊断工具,用于改进偏好优化方法,而我们的实证结果则识别了开发更先进对齐算法以实现全面偏好捕获的有前景的方向。
引用
@article{arxiv.2508.19922,
title = {HEAL: A Hypothesis-Based Preference-Aware Analysis Framework},
author = {Yifu Huo and Chenglong Wang and Qiren Zhu and Shunjie Xing and Tong Xiao and Chunliang Zhang and Tongran Liu and Jinbo Zhu},
journal= {arXiv preprint arXiv:2508.19922},
year = {2025}
}
备注
Accepted by EMNLP 2025 Findings