对齐中的人类偏好解码:逆宪法AI的改进方法
机器学习
2025-04-01 v2
摘要
传统方法,如强化学习从人类反馈(RLHF)和直接偏好优化(DPO),依赖于隐式原则,限制了可解释性。宪法AI(CAI)提供了一种明确、基于规则的框架,用于指导LLM对齐。建立在此基础上,我们改进了逆宪法AI(ICAI)算法,该算法从偏好数据集中提取宪法。通过改进原则生成、聚类和嵌入过程,我们的方法提高了从合成数据和真实世界数据集中提取原则的准确性和可泛化性。我们的结果突显了这些原则在促进更透明和可适应的对齐方法方面的潜力,为未来超越传统微调的进步提供了有前景的方向。
引用
@article{arxiv.2501.17112,
title = {Decoding Human Preferences in Alignment: An Improved Approach to Inverse Constitutional AI},
author = {Carl-Leander Henneking and Claas Beger},
journal= {arXiv preprint arXiv:2501.17112},
year = {2025}
}
备注
9 Pages, 3 Figures