标注对齐:比较 LLM 与人类对对话安全性的标注
计算与语言
2024-10-08 v4
摘要
LLM 是否与人类对安全性的感知相一致?我们通过标注对齐来研究这一问题,即 LLM 与人类在标注用户-聊天机器人对话安全性时的一致程度。我们利用最近的 DICES 数据集 (Aroyo et al., 2023),其中 350 段对话各由 112 名标注者进行安全性评分,这些标注者来自 10 个种族-性别群体。GPT-4 与平均标注评分的皮尔逊相关系数为 ,\textit{高于}单个标注者与平均评分的相关系数中位数 ()。我们表明,需要更大的数据集才能确定 LLM 在与不同人口统计学群体的相关性上是否表现出差异。此外,群体内部的相关性存在显著的个体差异,这表明种族和性别并不能完全反映对齐程度上的差异。最后,我们发现 GPT-4 无法预测某一人口统计学群体何时会比另一群体认为某段对话更不安全。
引用
@article{arxiv.2406.06369,
title = {Annotation alignment: Comparing LLM and human annotations of conversational safety},
author = {Rajiv Movva and Pang Wei Koh and Emma Pierson},
journal= {arXiv preprint arXiv:2406.06369},
year = {2024}
}
备注
EMNLP 2024 (Main). Main text contains 6 pages, 2 figures