Legend:利用表示工程为偏好数据集注释安全边际
计算与语言
2024-12-19 v2 人工智能
摘要
奖励模型在区分带有细微安全差异的响应方面依赖于高质量的偏好数据集,该数据集应捕捉有害和无害响应之间的细微差别。这就需要开发涉及偏好边际的数据集,以准确量化一个响应相对于另一个响应的无害程度。本文是首次提出一种有效且高效的框架,以促进边际增强型偏好数据集的开发。我们的框架 Legend 通过表示工程来注释偏好数据集。它在 LLM 的嵌入空间中构建表示安全的特定方向。通过利用这一安全方向,Legend 能够利用成对响应在该方向上的语义距离来自动注释边际。我们在奖励建模和无害对齐方面实验性地展示了我们的有效性。Legend 还以其高效著称,只需推理时间即可实现,不需要额外训练。这一效率使得 Legend 在实际应用中更容易实现和可扩展,特别适用于与安全对话的 LLM 对齐。
引用
@article{arxiv.2406.08124,
title = {Legend: Leveraging Representation Engineering to Annotate Safety Margin for Preference Datasets},
author = {Duanyu Feng and Bowen Qin and Chen Huang and Youcheng Huang and Zheng Zhang and Wenqiang Lei},
journal= {arXiv preprint arXiv:2406.08124},
year = {2024}
}
备注
Our code is available at https://github.com/colfeng/Legend