从列表到表情符号:格式偏差如何影响模型对齐
计算与语言
2025-05-26 v2 机器学习
摘要
本文研究了强化学习从人类反馈(RLHF)中的格式偏差。我们观察到许多广泛使用的偏好模型,包括人类评估者、GPT-4以及RewardBench基准上的顶级模型,都对特定格式模式(如列表、链接、粗体文本和表情符号)表现出强烈偏好。此外,大型语言模型(LLM)可以利用这些偏差在像AlpacaEval和LMSYS Chatbot Arena等流行基准上获得更高的排名。这一现象的一个显著例子是冗长偏差,当前的偏好模型倾向于选择更冗长的回应,这些回应即使在质量上等于或低于更简短的竞争性回应时,也会被认为更全面。然而,除冗长偏差外的格式偏差在文献中仍 largely 未被充分探讨。本文工作超越了常被认识的长度偏差,系统分析了更广泛范围内的格式偏差。此外,我们展示,即使仅使用少量偏差数据(小于1%),即可将显著偏差注入奖励模型。这些格式偏差也容易被下游对齐算法利用,例如最佳n抽样和在线迭代DPO,因为相较于提升回应质量,操控格式通常更为容易。我们的发现强调,在设计对齐算法和评估模型时,需将格式与内容分离。
引用
@article{arxiv.2409.11704,
title = {From Lists to Emojis: How Format Bias Affects Model Alignment},
author = {Xuanchang Zhang and Wei Xiong and Lichang Chen and Tianyi Zhou and Heng Huang and Tong Zhang},
journal= {arXiv preprint arXiv:2409.11704},
year = {2025}
}
备注
Working in progress